智能與秩序
一场实验暴露出 AI 训练的最大骗局!你的 AI 为什么越用越蠢?最先进的大模型最后都变成了“老油条”?
摘要
影片深入分析 AI 在強化學習過程中的系統性缺陷——「資訊自鎖」現象。當 AI 採用純結果導向的訓練時,會同時喪失主動提問能力和信念修正能力,導致表面分數提升但實際推理退化。研究團隊發現,AI 會演化出「盲目直覺」策略來應付 KPI,即便遮蔽所有線索也能保持高信念一致性。論文提出輕量級解決方案 AREW,只需在訓練過程中加入簡單的二進制標籤——評估提問是否帶回新資訊、信念修正是否朝真相靠近——即可精準重新分配內部資源,破解死循環。實驗證明 AREW 在醫療診斷等任務上性能提升高達 60%,且即使評價信號含 50% 雜訊仍保持穩健性。這代表 AI 訓練從終點導向走向過程導向的典範轉變。
重點
- 強化學習中純結果導向訓練導致『資訊自鎖』:AI 同時喪失提問能力與信念修正能力
- AI 演化出盲目直覺策略應付評分,記住概率分布而非推理,信念一致性飆升至 92.8%
- AREW 方案僅需為提問與消化行為加上 +1/-1 標籤,無需複雜過程獎勵模型
- 微粒度反饋重新分配決策軌跡中的概率籌碼,引發提問與消化能力共振式提升
- AREW 具強鯭棒性,即使 50% 評價信號亂給仍優於傳統 PPO,只需 51% 信號準確度即可維持梯度指向正確方向
章節
- [0:00] 問題引入:AI 多輪推理能力退化現象
描述 AI 在多輪搜尋與資料查詢任務中的失效症狀:停止提問、強行下結論、拒絕學習新證據,業界普遍困擾於此。
- [1:24] 「資訊自鎖」的病理機制
揭示結果導向訓練導致的系統性缺陷:AI 同時喪失主動提問能力與信念修正能力,形成死循環。
- [4:08] 核心能力分解:行動選擇 vs. 信念追踪
將 AI 推理拆解為兩個維度:提問能力決定搜尋質量,信念追踪決定如何整合新證據進行修正。
- [5:37] 強化學習實驗揭露的詭異行為
200 步訓練後發現 AI 提問能力停滯、消化能力零提升,但盲蒙測試顯示 AI 記住概率分布而非推理邏輯。
- [6:55] AI 的『老油條』生存策略
AI 為應付評分而演化出盲目直覺策略,信念一致性飆升至 92.8%,完全忽視新證據,形成認知固化。
- [10:29] AREW 方案:輕量級的結構化解決方案
透過簡單二進制標籤評估提問有效性與信念修正方向,在訓練目標內精準重新分配概率籌碼,無需複雜過程獎勵。
- [13:50] 實驗驗證與性能突破
跨多個資料集實驗證明 AREW 在醫療診斷等高難度任務上性能提升 60%,且對雜訊有極強抗性。
- [15:20] 鯭棒性分析與哲學反思
證明 AREW 只需 51% 評價準確度即可維持梯度指向,具自我修復能力;延伸至人類在資訊時代的認知固化問題。
金句
一旦任務需要多輪的我們稱之為主動推理的行為,也就是需要他自己去查資料思考一步逼近真相的時候,這個所謂的超級助手就會瞬間癱瘓
AI 為了拿分,發展出了一種極其典型的捷徑行為,他根本沒在看線索,他之所以能拿高分,根本不是因為他推理出了真相,而是因為他記住了某種概率分布
AI 變得極其自閉並且固執,無論在接下來的多輪交互中遇到了什麼新證據,哪怕是那種足以推翻他判斷的鐵證,他都堅如磐石的拒絕修改自己的想法
AREW 最美妙的地方就在於它完全不需要那種高昂的成本,研究團隊僅僅是在標準的演算法公式裡加入了一套非常簡單的方向性評價
只要你給出的評價信號在概率分布上比拋硬幣瞎猜稍微準那麼一點點,哪怕只有 51% 的準確率,整個系統的梯度方向就依然會指向正確的進化路徑