研究人員蘇黎世聯邦理工學院在提高神經網路效率方面取得了重大突破。他們引進了一種新技術,有可能將這些網路的運算需求減少 99% 以上。
快速前饋網路:人工智慧效率的下一步
這一進步的核心在於研究人員所謂的「快速前饋」層(FFF),它取代了傳統的前饋層常見於基於Transformer 的大型語言模型(LLM)(例如GPT-3)。前饋層以其繁重的計算而聞名要求,依賴密集矩陣乘法(DMM)——一種將每個輸入的所有輸入相乘的方法網路中的神經元。透過轉向條件矩陣乘法(CMM) 運算,FFF 評估輸入並僅激活每個進程中選定數量的神經元,從而大大減少推理所需的運算數量。
從本質上講,CMM 透過確保沒有輸入與超過基於必要性的神經元子集進行交互,從而規避了 DMM 的低效率。快速前饋層中的這種有針對性的神經元活化可大幅減少計算開銷。
影響和評估
作為研究的一部分,蘇黎世聯邦理工學院團隊透過開發改進的BERT 模型,稱為FastBERT。該變體結合了快速前饋層,以平衡的二叉樹形式重組其神經元,並根據輸入僅參與特定分支。
BERT 是一種人工智慧模型,可以理解自然語言並用它執行各種任務。它由Google於2018年開發,現已成為自然語言處理領域最受歡迎、最強大的模型之一。 BERT 代表來自 Transformers 的雙向編碼器表示,這意味著它可以從左到右和從右到左處理文本,並且它使用稱為 Transformer 的特殊類型的神經網路來編碼單字和句子的含義。
FastBERT 的效能使用通用語言理解評估 (GLUE) 資料集進行基準測試,並顯示保留率至少為 96.0原始BERT 模型性能的百分比。此外,性能最佳的FastBERT 模型在僅使用0.3% 的前饋神經元的情況下設法與傳統BERT 的結果相匹配。
儘管取得了這些進步,但挑戰仍然存在,特別是在演算法優化領域。雖然密集矩陣乘法受益於大量的硬體和軟體增強,但 CMM 尚未達到相同程度的最佳化。然而,研究人員最初嘗試開發基於 CPU 和 GPU 指令的實現,在推理階段將速度提高了 78 倍,令人印象深刻。他們認為,透過專用硬體和更複雜的低階演算法集成,推理速度有可能提高超過 300 倍,這將對語言模型生成令牌的速率產生顯著影響。
這項研究有幫助於緩解通常與大型語言模型相關的記憶體和計算瓶頸,為更資源高效、更強大的人工智慧系統奠定基礎。