Intelligence & Order
Google黑科技GDIO:让大模型拥有“永不遗忘”的无限大脑!
Summary
Google 與威斯康辛大學聯合發表的 GDIO 方法,解決大語言模型微調時的「災難性遺忘」問題。傳統微調會因梯度下降強制改寫神經網路權重,導致模型喪失基礎常識能力。GDIO 透過在多層感知機(MLP)進行函數保留擴建,以水平克隆上投影矩陣、垂直克隆並除以二下投影矩陣的方式,在初始化時達成數學等價性,不引入噪音。並根據任務複雜度採用全局凍結或特定訓練策略,透過按需擴展只升級 30% 參數,實現零遺忘的新知識習得。該方法從微觀神經啟用層面驗證,維持 0.95 的函數向量相似度,為持續學習型 AI 提供底層架構。
Key points
- 標準微調利用梯度下降粗暴改寫權重,導致模型學新知識時遺忘舊知識,形成零和博弈困境。
- GDIO 透過 MLP 維度翻倍與精準初始化,實現物理容量擴建且保持數學等價,無須外加隨機噪音。
- 採雙軌梯度策略:全局凍結策略保護舊知識,特定訓練策略開放上投影矩陣學習深度推理。
- 按需擴展僅升級中間層 9-10 層,計算成本腰斬同時達成全覆蓋效果,兼顧實用性與資源效率。
- 透過函數向量與啟用修補技術驗證,GDIO 保持 0.95 相似度與核心因果頭,確保認知靈魂未毀損。
Chapters
- [0:00] 災難性遺忘的問題陳述
揭示大語言模型微調時的核心困境:學習新知識會摧毀舊知識,導致模型淪為失憶症患者,無法兼顧專才與通才能力。
- [3:34] 過去四種解決方案的失敗
分析正則化、上下文學習、LoRA 低秩微調、網路生長等方法的局限,均陷入妥協或能力天花板問題。
- [9:41] Transformer 架構中 MLP 的角色
糾正誤認為注意力是知識儲存地的迷思,闡明 MLP 才是真正的事實知識與邏輯推理的「硬碟」,採用偵探與圖書管理員比喻。
- [13:43] GDIO 函數保留擴建的數學機制
詳解水平克隆上投影矩陣、垂直克隆並除以二下投影矩陣的巧妙初始化,達成零噪音的數學等價性與物理擴容。
- [17:56] 梯度更新的雙軌策略
介紹全局凍結策略(保護舊知識)與特定訓練策略(開放上投影層學習複雜推理),針對不同任務複雜度的精準控制。
- [21:28] 按需擴展與工程最佳化
展示只需升級中間層 9-10 層即可達全覆蓋效果,計算成本腰斬,驗證更大模型仍保持擴展性與零遺忘特性。
- [22:52] 函數向量與微觀神經機制驗證
透過啟用修補技術與因果追蹤,驗證 GDIO 保持 0.95 向量相似度與核心因果頭運作,確保認知靈魂完整。
- [26:21] 對未來持續學習 AI 的展望
總結 GDIO 為通用人工智慧提供底層基礎設施,使模型能在物理層面無限進化、永不遺忘,成為真正的全知大腦。
Quotes
這就像是一台重型推土機直接粗暴的推平了抹除了支撑模型原有技能的那些複雜的神經回路,你確實在廢墟上建立起了一座嶄新的專業大廈,但你失去了一整座原本繁華的充滿常識的城市。
大模型的真理常識和事實性知識其實全都被固化在這個叫做 MLP 的硬碟裡,我們可以把多層感知機看作是一個巨大的鍵值對字典。
通過水平複製加上垂直複製並嚴格除以二這個補償操作,研究人員在純粹的數學層面上實現了一個絕妙的平衡,既在物理空間上把網路擴寬了一倍,又在初始化的絕對位置死死的鎖住了原有的輸出值。
使用 GDIO 擴容微調後,代表原版認知靈魂的向量相似度不可思議的高達 0.95,而且模型穩穩的保住了最核心的五個頂級因果頭。
它為構建真正的持續學習智能體提供了一個強有力的底層數學架構,這極有可能會成為未來所有大型 AI 模型向通用人工智慧邁進的標配基礎設施。