TL;DR:Looped transformer 就是把同一疊層重複跑。ICLR 2025 有一篇論文在其設定下證明,繞 T 圈足以模擬 T 步思維鏈,差別在於後者每一步都留下文字。圈數目前沒被調大,原因是訓練會不穩,而 2026 年有三組工作正在把那些不穩修掉。Fu 等人的摘要直接把「圈數可在推論時調整」寫成優點,這正是安全研究者說的那個旋鈕。
上一篇寫 Astra 那場爭論的時候,我犯了一個錯。
我引了一串「規模越大、圈數反而越少」的對照,用它去反駁中文報導「圈數會一路飆」的說法。那串數字來自一篇 LessWrong 文章裡由模型代為彙整的文獻回顧,作者自己註明那批論文他大多沒有逐篇讀過。
後來我把那七篇的摘要逐篇調出來看。那串圈數,摘要裡一個都沒有。
這句話要講精確:我查的是摘要,不是全文。那些數字可能寫在正文或附錄裡,我沒有排除這個可能。我能確定的只有一件事,它們沒有出現在作者選來代表這篇論文的那段話裡。
而摘要寫的事情,跟我原本想主張的方向對不太上。下面第三、第四節就是那些內容。
這篇是那次回查的結果。
循環的 Transformer 到底在重複什麼?
先把機制講到夠細,後面每一段都靠它。
一般 Transformer 處理一個 token 時,資訊從第一層流到最後一層,每層各有一份自己的權重。48 層就是 48 組不同的參數,跑完一次,輸出下一個字。
Looped transformer 換了一個做法:讓其中一疊層被重複使用。跑完一輪,把輸出餵回同一疊層跑第二輪,跑夠了才往下走。同一組權重被造訪很多次。
開源模型 Nanbeige 4.2 是個乾淨的例子。它把 22 層的層堆跑兩次,等於得到 44 層的深度,但因為權重共用,儲存空間仍然只有 22 層的量。代價是運算量接近兩倍。Sebastian Raschka 在他的技術筆記裡提到,Nanbeige 的研究者發現兩次是最好的取捨,跑更多次幾乎沒有增益,訓練卻慢得多、貴得多。
既然重複用層在效果上接近把層數加倍,「繞幾圈」這個數字實際上就是「這個模型有多深」的另一種寫法。它是深度本身,不是一個附加設定。
但要先把兩種情況分開,後面的推論才不會滑掉。Nanbeige 是在訓練時就把圈數固定成兩次,展開深度寫死了,跑起來跟一個 44 層的模型沒兩樣。另一種做法是把模型訓練成能用不同圈數運作,圈數在推論時才決定。只有後者才配叫旋鈕。這兩種都存在,而 Astra 屬於哪一種,目前沒有公開資訊。
繞圈跟寫草稿,是同一件事的兩種做法嗎?
Saunshi 等人在 ICLR 2025 發表的〈Reasoning with Latent Thoughts〉提出一個比較強的主張:很多推理問題需要的是深度,參數量沒那麼要緊。他們的實驗結果是,k 層繞 L 圈的效能接近 kL 層不繞圈的模型,而且明顯好過 k 層只跑一次。
關鍵在後半段。他們在論文的設定下證明,looped 模型會隱式地產生潛在思考,繞 T 圈足以模擬 T 步的思維鏈。他們也觀察到,looped 與非 looped 模型的擴展行為都取決於有效深度,形態類似思維鏈在推論時的擴展。
要注意這個結果的方向。它說的是繞圈能模擬草稿,不是說兩者等價、可以自由對調。但單向就夠用了:模型要多想幾步,可以把想法寫成文字再讀回去,也可以在同一疊層裡多繞幾圈,而後面這條路走得到前面那條路的地方。
差別在於,寫下來那條路的每一步都留下人看得懂的字。
思維鏈之所以能被監控,從來不是因為有人設計了監控機制。它能被監控,是因為模型當時只有那一條路可以走。
這正是〈Neuralese 是什麼〉那篇在擔心的事。當時的問題是 AI 會不會發展出一種不寫成文字的思考方式;Saunshi 這篇的結果說明,那條路在架構上本來就存在。
繞圈到底划不划算?學界吵的是這一題
中文報導把「圈數會一路飆」寫成既定趨勢。但學界真正在吵的問題,比那個具體得多。
Loopie 論文(〈Loop the Loopies!〉,2026 年 7 月)的摘要開宗明義:這個領域長年的難題是,在同等預訓練運算量下,把參數翻 N 倍通常勝過把模型繞 N 圈。
一句話講完了為什麼過去十年沒人這樣做。不是沒想到,是不划算。
Loopie 的貢獻就是宣稱處理了這個難題。它是兩個 Mixture-of-Experts 模型,20B 參數中 2B 活躍,以及 6B 中 0.6B 活躍。作者說在相同運算預算下,它明顯勝過一般 Transformer 的基線,並在 2025 年的國際數學奧林匹亞與物理奧林匹亞達到不用工具的金牌等級表現。
Ouro(〈Scaling Latent Reasoning via Looped Language Models〉)的結果指向同一件事。1.4B 和 2.6B 的模型,訓練 7.7T tokens,在多項評測上追平最高到 12B 的當代模型。作者透過對照實驗說明,這個優勢的來源是知識操作能力變好,知識容量並沒有跟著變大。
所以那句「多繞圈划不划算」,2026 年的答案正在從「不划算」翻過來。
那圈數為什麼還沒被一路調大?
因為訓練會壞掉。而這是工程問題,不是物理上限。
Fu 等人的〈Simply Stabilizing the Loop via Fully Looped Transformer〉把病因寫得很清楚:圈數一多,訓練不穩定,來源有兩個,梯度震盪與殘差爆炸。他們提出兩個不增加參數的修法去壓住它。
DeepLoop(〈Depth Scaling for Looped Transformers〉)從另一個角度處理同一件事。用白話講:圈數一多,同一批權重會被重複造訪,梯度疊加得太猛,所以必須更用力把殘差壓小。論文的推導是,一般 Transformer 的每個殘差分支各自收到自己的參數更新,循環架構卻是同一份共用的更新聚合了重複造訪累積的梯度,下一輪又被同一批造訪讀回去;在保守情況下,殘差縮放的指數必須從四分之一提高到二分之一。另外還有一篇 Parcae 在做循環語言模型的穩定擴展律。
把這幾篇擺在一起:光是處理訓練穩定性,2026 年就有三組不同的工作在推同一扇門。
這跟「圈數在往下走」是兩個不同的故事。
圈數到底是不是一個旋鈕?
安全研究者把它叫做旋鈕,OpenAI 那邊沒有直接否認。但最乾脆的一句話,其實是研究者自己寫的。
Fu 等人那篇摘要,在講完 looped transformer 的好處之後接了一句:由於圈數可以在推論時調整,它也提供了一個平衡效能與測試期運算的天然機制。
這句話是當成優點寫的。它跟 Ryan Greenblatt 擔心的「一個目前設得很低、但可以輕易調高的旋鈕」,講的是同一個東西,只是立場不同。(Greenblatt 是 AI 安全研究者,這場爭論起於外界懷疑廠商可以在不公開的情況下把不可見的推理深度往上調。)
一項架構特性同時是研發端的賣點和安全端的隱憂,這在 AI 領域不算罕見,但很少像這次一樣,兩邊用的幾乎是同一句描述。
要補一個限定:這種可調性需要模型本來就被訓練成能用不同圈數運作。一個以固定圈數訓練出來的模型,推論時亂改圈數會壞掉。所以旋鈕的存在是一個訓練期的選擇,不是所有循環模型天生都有。
Ouro 帶來的是更進一步的版本。它的訓練目標裡有一個熵正則化項,用來學習深度分配;換句話說,那是一個會逼模型省著用計算步數的懲罰項,於是繞幾圈變成模型自己學會針對不同輸入去決定。
如果這條路走通了,旋鈕就不在人的手上了。它會被編進訓練目標裡,而外界要查的東西,從「你把參數設成幾」變成「你的模型學會了什麼樣的深度策略」。後面那個問題難查得多。
繞圈的模型比較好讀,還是比較難讀?
這一題目前沒有定論,而定論之所以要緊,是因為它決定現有的監控工具還能撐多久。
支持「比較好讀」的有三組線索。
Ouro 論文自己宣稱,LoopLM 產生的推理軌跡跟最終輸出的對齊度,高於顯式思維鏈。顯式思維鏈的老問題正是模型嘴上說一套、實際算另一套,而 Ouro 給的數據指向繞圈的軌跡在這件事上表現更好。
LessWrong 上有兩位做過相關實驗的研究者提到,如果模型被訓練成能用不同圈數運作,那麼每一圈結束時的中間狀態,本身就必須維持在能被解碼成合法 token 的狀態,因為那一圈隨時可能就是最後一圈。一般深層 Transformer 的第 37 層沒有這個約束。其中一位在 Ouro-2.6B 上自陳實測,超過 95% 的 token 每一圈輸出都相同,而那些會變的 token 剛好標出模型真的用上額外深度的位置。這個數字我沒有獨立覆核,它來自留言區的個人實驗。
反方的說法也有分量。有人指出循環架構的表達力比同等深度的一般 Transformer 更高,某些操作它能隱式學會而一般架構學不會,這讓監控更難。Rauno Arike 的回應是,權重綁定其實是一種限制,k 層繞 L 圈是 kL 層模型的一個特例,函數空間更小而不是更大。
這場交鋒還沒收尾。但它至少說明一件事:把「架構變複雜」直接等同於「更不透明」,是一個沒有經過驗證的直覺。
「我們限制了使用程度」算不算一個承諾?
把前面幾節收在一起,治理的問題就浮出來了。
圈數等於深度。深度可以在推論時調整。調大它划不划算,學界的答案正在翻轉。而模型可能自己學會決定要繞多深。
在這個背景下,一家公司說「我們限制了這項技術的使用程度」,這句話能不能被當成承諾?
Geoffrey Irving 給了一個具體的判準。他說他請教過電路複雜度的專家,共同的意見是:要從限制電路深度裡拿到有意義的保證,你得把深度壓得非常低。如果界線是「幾百層」或者「我們偶爾會吐一個 token」,那是個假約束。他用了一個對照:這相當於說「我們有監控思維鏈」卻不討論錯誤率。現實是按數字分級的,不是按「我們試過了」這種二元判斷。
這個判準在企業場合直接可用。任何形態的控制措施,只要它的敘述裡沒有數字和誤差,它就還不是一個可以被稽核的東西。
Greenblatt 在 OpenAI 首席科學家 Jakub Pachocki 回應之後追問的三件事,走的是同一條路:有沒有現成的方式可以用高很多的深度去部署它;這個模型在不可見推理能力上是不是一次超出趨勢的跳躍;這個架構有沒有引入一個天生就很適合大幅放大的深度參數。
三個問題問的都是刻度。
這條紀律我在小得多的規模上實作過,而且只在方法論這一層可以類比。我讓一批排程每天檢查自己的系統,但真正在把關的那幾支,做的事情是拿一份寫死的契約檔,逐條打線上的實際回應,比對狀態碼對不對得上,而不去問系統「你還好嗎」。狀態碼是確定性的,神經網路的不可見推理不是,稽核技術本身完全不能平移。能平移的只有一句:驗證標準不能來自受檢者的自陳。這是任何稽核的第一課,只是在 AI 這一層還沒有被制度化。
沒有刻度的旋鈕
我對這批論文的判斷是這樣。
Looped transformer 不神祕,它是一個工程上很合理的選擇。它現在圈數不多,是因為訓練還不夠穩,不是因為有人在守著它。而那些不穩,正在被五組不同的人同時修。
安全研究圈這波反應之所以那麼大,我認為關鍵不在 Astra 這次做了什麼,而在大家看懂了這條路的形狀:一個既是賣點又是隱憂的參數,一個可以在訓練時就決定要不要留給推論期去調的深度,以及一個目前只能靠廠商自陳的查核鏈。
至於刻度該由誰讀、讀到什麼精度、讀完的紀錄留在哪裡,這三題我在上一篇結尾寫過還沒有答案。
回查完七篇摘要之後,我要補上第四題:連論文自己寫了什麼,都要有人真的去讀。這一題的門檻最低,而我上一篇就是在這裡出的錯。
想看這條線上的其他討論,可以往「智能與秩序 → AI 治理」走。
💬 留言討論
載入中...