智能與秩序

谷歌:DeepMind 曝光 Transformer 底层死穴!

YouTube2026/06/23

摘要

解讀 Google DeepMind 一篇論文《Transformer 的拓撲學難題》:Transformer 本質是有向無環圖,資訊只能向前流動,導致它在長週期任務中無法像人類一樣穩定維護一個持續演化的狀態,只能靠擴大上下文窗口這類補償策略勉強撐住。論文用猜數字與河岸/銀行歧義兩個實驗證明模型只是在表演思考而非真正追蹤狀態,並分析三條解決路線:深度循環、步級循環、深度加步級雙循環,其中最有希望的雙循環路線目前工程難度極高、尚無人真正做出來。內容為簡體中文頻道轉寫,已正體化與用語校正。

重點

  • Transformer 是有向無環圖(DAG),信息只能往前推進,模型層數多寡決定了狀態能被往上搬運多少步,超過層數就會被擠出頂層而丟失(層級透支)
  • 猜數字實驗:模型雖生成了正確的目標數字並放入上下文,卻在第 51 步給出與第 50 步矛盾的答案,證明它不是在追蹤狀態而是在表演追蹤
  • 河岸與銀行歧義實驗:模型正確理解銀行指河岸後,被追問卻立刻滑向金融機構語意,且完全沒意識到自己的解釋已經切換
  • 思維鏈的代價可用公式 R等於T除以K 表示(T 為消耗 token 數、K 為實際內部推理步數),R 越大代表模型花越多 token 用嘴說出思考過程,長週期任務中上下文會被關於思考的報告塞滿
  • 三條架構解法:深度循環(層間加回路,被判定為治標不治本)、步級循環(Mamba、RWKV7 等,拿到內心獨白門票但常規更新機制仍無法保證穩定追蹤)、深度加步級雙循環(最有希望但工程難度最高,目前無人做出)
  • 結論:三年架構創新已解決表達力與訓練穩定性問題,但讓狀態追蹤真正可靠這件事仍未被解決,這也解釋了為何複雜 agent 系統在長週期任務裡容易崩潰

金句

你往牆上加再大的窗戶,樓的層數還是死的。
0:00
你的上下文窗口不是被思考填滿的,是被關於思考的報告填滿的。
7:43
探索碰撞 ↗

快速瀏覽

專案動態牆搜尋

深度探索

系列核心概念知識圖譜碰撞
關於聯絡我
繁简EN日
字級