TL;DR:2026 年 9 月 1 日,OpenAI 官網說「我們替 Astra 加上額外的思維鏈監控」,同一天 The Information 報導 Astra 用了會讓思維鏈更難監控的架構。攤開一手來源後,兩句話其實可以並存:Astra 用的 recurrent depth 是同一疊層多跑幾次,公開推估約三到四次、官方沒有證實,跟 neuralese 不是同一件事。這次值得記住的是另一件事:循環次數成了一個在推論時就能調大、而外人看不到刻度的旋鈕。

▶ 聽摘要
AI 合成語音・作者本人聲線克隆

9 月 1 日,OpenAI 在官網貼出〈Path to Astra〉。那份文件裡有一句話:「我們在部署 Astra 時會額外加上思維鏈監控,以便快速偵測並圍堵可能失準的行為。」

同一天,The Information 報導 Astra 採用了一種讓部分推理不再以自然語言呈現的架構。

兩份文件同一天出現,讀起來像在講兩件相反的事。接下來 48 小時,社群平台上的討論基本上就繞著這個矛盾打轉。

我在 2025 年寫過〈Neuralese 是什麼?AI 用非語言推理思考時,人類的語言主權就終結了〉。那篇裡有一句話,現在需要更新:「截至目前,主要 AI 公司尚未在前沿模型中正式實作 Neuralese CoT。」

這篇是那句話的更新。但更新的方向,跟我這幾天在中文圈看到的版本不太一樣。

9 月 1 日到 9 月 3 日,實際發生了什麼?

時序值得先擺清楚,因為這次的爭論有大半來自於各方在不同時間點掌握的資訊量不同。

9 月 1 日:The Information 報導,一名知情人士指出 OpenAI 在 Astra 上使用了 recurrent depth,也稱 looped transformer。報導同時提到 OpenAI 限制了這項技術的使用程度,以維持思維鏈的可讀性。同一天 OpenAI 發布〈Path to Astra〉,宣告 Astra 是第一個在其 Preparedness Framework 下達到「Critical」網路安全能力門檻的模型。

9 月 2 日:Redwood Research 的 AI 安全研究者 Ryan Greenblatt 在 X 上寫道,如果報導屬實,這「可能是迄今對 AI 安全與資安最糟的一項發展」。AI Futures Project 的 Daniel Kokotajlo 則貼了一句髒話。幾小時後,OpenAI 首席科學家 Jakub Pachocki 公開回應:「我想避免一場由混亂報導引發的、奔向不可監控性的競賽。我們現役前沿模型(包含 Astra)的計算圖深度,在 GPT-4 的兩倍以內。」

同一天,Sebastian Raschka 在他的部落格貼出一篇技術澄清,直說 looped transformer 沒那麼玄。獨立研究者 Rauno Arike 在 LessWrong 發表一篇逐項拆解,把「該擔心」與「不該擔心」的理由分開列。

9 月 3 日:Fortune 與 Transformer 陸續整理報導。同一天,中文圈開始出現「AI 推理徹底消失」「人類完全讀不懂」這類標題。

從第一則報導到第一份技術澄清,中間隔不到 24 小時。但傳到中文圈的,多半只有前半段。

什麼是 looped transformer?它跟 neuralese 差在哪?

先講清楚機制,後面的判斷才有地基。

一般 Transformer 處理一個 token 時,資訊從第一層依序流到最後一層,每層各有一份自己的權重,跑完就輸出。Looped transformer 的作法是讓其中一疊層被重複使用:跑完一輪,把輸出再餵回同一疊層跑第二輪,跑夠了才往下走。

Raschka 用開源模型 Nanbeige 4.2 舉了個具體例子。它把 22 層的層堆跑兩次,等於得到 44 層的深度,但因為權重共用,儲存空間還是 22 層的量。代價是運算量接近兩倍。這個技巧在學界至少從 2023 年就有人做,NeurIPS 的 Mixture-of-Recursions 論文還進一步加了一個路由器,讓簡單的 token 少繞幾圈、困難的多繞幾圈。

Neuralese 是另一件事。它指的是模型幾乎完全在高維潛在空間裡推理,中間不產生任何人類可讀的步驟。用比喻來說:思維鏈是你解題時把每一步寫在草稿紙上,neuralese 是全部心算、只報答案。

Raschka 那篇的關鍵一句是:重複使用層本身不會壓掉可見的思維鏈,它只是在輸出下一個 token 之前多做一些隱藏狀態的運算,跟一般 Transformer 的層在做的事同類。他也直接寫道,把模型加大(例如從 GPT-5.6 Luna 升到 Sol)會產生同樣的效果。

換句話說,兩者都會讓更多運算留在文字之外,但 recurrent depth 往那個方向移動的距離小得多。

Pachocki 說的「GPT-4 的兩倍以內」是什麼意思?

這句話是這次爭論裡資訊量最大的一句,也是最容易被略過的一句。

「深度」在這裡指的是模型在必須寫下點什麼之前,一次能想多遠。

先用一句白話擋掉最容易的誤會:這裡講的是「多算幾層再吐出下一個字」,不是「多寫幾段草稿」。深度算的是每生出一個字之前底層堆疊了幾層運算,跟草稿的長度是兩回事。草稿可以拉得很長,而每一步的深度仍然很淺。推理模型正是靠「每步很淺、但步數很多」在撐長推理。

GPT-4 是 2023 年的模型,它一次想不了太遠,這正是後來的推理模型必須靠寫草稿撐住長推理的原因。如果 Astra 每一步的計算深度最多只有 GPT-4 的兩倍,代表它仍然得把大部分推理寫下來。

Rauno Arike 據此推估:Astra 的循環次數大約是三到四次。他的推理是,一個 looped 推理模型的單層堆大概比 GPT-4 淺一些,但不會淺超過兩倍。

這個估計沒有經過 OpenAI 證實。但它是目前公開資訊下最具體的一個數字,而且它跟 The Information 自己報導的「OpenAI 限制了使用程度」是相容的。

中文圈的報導放大了哪三處?

我讀了幾篇中文報導,其中一篇的標題是〈OpenAI Astra 神經語揭秘:高維向量思考讓 AI 推理徹底消失〉。內容不能說全錯,它甚至在後段自己寫了「Astra 用的是循環深度,不是完全的神經語」。問題出在放大的比例。

第一處,標題與內文互相矛盾。 標題斷言 Astra 用神經語思考、推理徹底消失,內文卻承認 Astra 用的是循環深度、而 OpenAI 明確否認轉向 neuralese。一篇文章裡兩個相反的結論,多數讀者只會記得標題那個。

第二處,Huginn 那句話的兩個數字都失真了。 那篇寫道,馬里蘭大學的 Huginn 模型「用 35 億參數、循環 50 圈,打出接近 500 億參數模型的效果」。

回到論文摘要原文:模型是 3.5B 參數、訓練 800B tokens,效能提升「up to a computation load equivalent to 50 billion parameters」。這句話講的是運算負載的等值。一個 3.5B 的模型多繞幾圈之後,吃掉的運算量可以逼近 50B 模型的量級;它在各項評測上表現得如何,是另一個問題,摘要並沒有宣稱兩者相當。

圈數也對不上。依 Rauno Arike 的整理,Huginn 訓練時最多用到 32 圈、測試時外推到 64 圈。50 這個圈數我在論文摘要裡找不到對應,它可能來自內文某張圖,也可能是轉譯時跟前面那個 50 混在一起。我不打算猜。

能確定的是:一句講運算成本的話,被讀成了一句講能力的話。而能力的宣稱,份量比成本的宣稱重得多。

第三處,趨勢的方向沒有它說的那麼確定。 那篇的隱含結論是循環次數會一路往上飆。

我原本想引一串「規模越大、圈數反而越少」的對照去反駁它。材料來自 Rauno Arike 那篇裡由模型代為彙整、他自己註明大多沒有逐篇讀過的文獻回顧。後來我把那批論文的摘要逐篇調出來看,那串圈數在摘要裡一個都找不到。

摘要寫的是別的事。Loopie 的作者開宗明義說,這個領域長年的難題是「在同等預訓練運算量下,把參數翻 N 倍通常勝過把模型繞 N 圈」,而他們這篇的貢獻就是要突破這個限制。Fu 等人那篇處理的是圈數一多訓練就不穩的問題,同時明講「圈數可以在推論時調整」是這個架構的天然機制。

換句話說,2026 年這批論文在做的事,是讓更多圈變得可行。

所以我不能說那篇中文報導把趨勢講反了。我只能說:它把一個還在被積極推翻的限制,寫成了既定的下坡路,而它引來當證據的 Huginn,本身並不支持那個結論。

這一段是我自己踩到的坑,順便留在這裡。我拿別人請模型整理的文獻回顧當證據,去指認別人引用不實。回查之後那串數字站不住,差別只在它沒有進到最後的版本。

一個反直覺的發現:循環架構可能比較好解讀

這一段在中文報導裡完全沒有出現。

在 Rauno Arike 那篇的留言區,有兩位做過相關實驗的研究者提到同一件事:如果模型被訓練成可以用不同的循環次數運作,那麼每一圈結束時的中間狀態,本身就必須是一個能被解碼成合法 token 的狀態。因為在訓練分布裡,那一圈隨時可能就是最後一圈。

這個約束在一般的深層 Transformer 裡不存在。第 37 層的中間狀態沒有義務長得像任何一個字。

其中一位研究者在 Ouro-2.6B 上實測後補充:超過 95% 的 token 在每一圈的輸出都相同,而那些會變的 token,正好標示出模型真的用上額外深度的位置。他也說明,這比不上完整的思維鏈,因為你只拿得到單一 token 層級的讀數,讀不到一段連貫的推理。

這裡有個前提要講清楚:整個性質建立在「模型被訓練成能用不同圈數運作」之上。如果 Astra 用的是固定圈數、中間那幾圈從來不必獨立輸出,這個性質對它就不成立。Astra 屬於哪一種,目前沒有公開資訊。

所以我不會把這段當成安心的理由。但它示範了一件事:把「架構變複雜」直接等同於「更不透明」,是一個沒有經過驗證的直覺。

那真正該擔心的是什麼?

拆完誤讀,剩下的部分仍然值得擔心,只是擔心的位置跟中文報導講的不同。

先說為什麼這條線這麼多人在守。2025 年有一篇由 OpenAI、Anthropic、Google DeepMind 研究者共同參與的論文,把思維鏈的可讀性描述為一個難得但脆弱的安全機會,並呼籲業界研究如何保住它。它脆弱的原因就在於,它是訓練過程的副產品,沒有任何機制保證它會一直存在。

這裡要先擋掉一個很自然的反問:如果多繞幾圈的效果跟把模型加深加寬同類,那把圈數調大不就等於換一個更大的模型嗎?為什麼沒人管加大模型叫旋鈕?

Rauno Arike 給了一個我認為站得住的區分。把模型加深,成本落在預訓練:要重跑一次昂貴的訓練,而且訓練完之後深度就固定在那裡,推論時加不了。循環架構不一樣,可以用低圈數訓練,之後靠少量微調、甚至零樣本,就在推論時把圈數往上調。

同樣是變深,一個要重新訓練一次,一個改一個推論參數就好。旋鈕這個字指的是後者。

Greenblatt 在 Pachocki 回應之後補了一段,講的正是這件事:那則聲明與「Astra 存在一個目前設得很低、但可以輕易調高的旋鈕」是完全相容的。他接著列出三個他想知道的問題,包括這個架構是否引入了一個新的、天生就很適合大幅放大的深度參數。

Apollo Research 的 Marius Hobbhahn 講得更直白:只要更深能換到更強,壓力方向就是往更深走。

這裡有一個滑坡的形狀:每一步都不算特別危險,走完一段之後回頭看,離出發點已經很遠了。這也是為什麼有人主張第一步就不該踏出去。

還有一層,我認為對台灣的讀者更實用。OpenAI 政策團隊 Strategic Futures 的負責人 Dean Ball 一邊駁斥這波恐慌,一邊指出整個產業是在社群平台的時間軸上,判斷一項技術複雜的說法,而幾乎沒有任何可對照的事實基礎。他的結論是:這正是需要法定獨立稽核與技術評估的理由。

Transformer 那篇文章的留言區有位讀者補了一個具體的參照點,我回查法條原文後確認對得上:歐盟 AI 法案附件十一第一節第 1 點 (d) 要求通用模型提供者記載「架構與參數量」(the architecture and number of parameters),第 2 點 (b) 要求記載關鍵設計選擇及其理由與假設;具系統性風險的模型另受第二節第 3 點約束,要提交系統架構的詳細說明,交代各軟體元件如何彼此銜接。

所以規範是有的,落差在誰看得到。那份文件交給的是 AI Office,不會公開給讀者。一位首席科學家在 X 上引用的深度數字,跟一份送交主管機關的技術文件,是兩種不同性質的東西。

讀不到的東西,就管不到

我自己的工作流裡有一小塊會被這件事直接影響。

我平常會把同一份程式碼或同一份分析,同時丟給幾個不同廠商的 agent 各自審一遍,再把它們的分歧攤出來自己判斷。這套作法能成立,唯一的原因是它們願意把理由寫成我讀得懂的字。它們的結論我未必信,但我至少能看到它們是怎麼走到那個結論的,然後決定要不要接受。

如果哪天這些 agent 之間改用一種對彼此更有效率、對我不可讀的格式互傳,我這套交叉驗證就會退化成投票:我只剩下數幾票贊成、幾票反對,看不到理由。這跟我在前一篇裡寫的「連要求它解釋這個最基本的監督手段都失去了」是同一件事,只是縮小到一張桌子的尺度。

所以我對這次的判斷是這樣:neuralese 沒有發生。發生的是另一件事,模型多了一個控制推理深度的旋鈕,而外界沒有任何管道知道它現在停在哪一格,只能聽廠商說。

我在〈Neuralese 是什麼〉裡寫的那句「主要 AI 公司尚未在前沿模型中正式實作 Neuralese CoT」,嚴格說起來現在仍然成立。

需要更新的是後半段:這件事現在已經不再是「有沒有做」的二元問題,而是「做到什麼程度、誰有權查、查完給誰看」的問題。

而這三題,目前一題都沒有答案。

想看這條線上的其他討論,可以往「智能與秩序 → AI 治理」走。