TL;DR:2026 年 9 月 1 日,OpenAI 官网说「我们替 Astra 加上额外的思维链监控」,同一天 The Information 报道 Astra 用了会让思维链更难监控的架构。摊开一手来源后,两句话其实可以并存:Astra 用的 recurrent depth 是同一叠层多跑几次,公开推估约三到四次、官方没有证实,跟 neuralese 不是同一件事。这次值得记住的是另一件事:循环次数成了一个在推理时就能调大、而外人看不到刻度的旋钮。
9 月 1 日,OpenAI 在官网贴出〈Path to Astra〉。那份文件里有一句话:「我们在部署 Astra 时会额外加上思维链监控,以便快速侦测并围堵可能失准的行为。」
同一天,The Information 报道 Astra 采用了一种让部分推理不再以自然语言呈现的架构。
两份文件同一天出现,读起来像在讲两件相反的事。接下来 48 小时,社群平台上的讨论基本上就绕着这个矛盾打转。
我在 2025 年写过〈Neuralese 是什么?AI 用非语言推理思考时,人类的语言主权就终结了〉。那篇里有一句话,现在需要更新:「截至目前,主要 AI 公司尚未在前沿模型中正式实作 Neuralese CoT。」
这篇是那句话的更新。但更新的方向,跟我这几天在中文圈看到的版本不太一样。
9 月 1 日到 9 月 3 日,实际发生了什么?
时序值得先摆清楚,因为这次的争论有大半来自于各方在不同时间点掌握的信息量不同。
9 月 1 日:The Information 报道,一名知情人士指出 OpenAI 在 Astra 上使用了 recurrent depth,也称 looped transformer。报道同时提到 OpenAI 限制了这项技术的使用程度,以维持思维链的可读性。同一天 OpenAI 发布〈Path to Astra〉,宣告 Astra 是第一个在其 Preparedness Framework 下达到「Critical」网络安全能力门槛的模型。
9 月 2 日:Redwood Research 的 AI 安全研究者 Ryan Greenblatt 在 X 上写道,如果报道属实,这「可能是迄今对 AI 安全与资安最糟的一项发展」。AI Futures Project 的 Daniel Kokotajlo 则贴了一句脏话。几小时后,OpenAI 首席科学家 Jakub Pachocki 公开回应:「我想避免一场由混乱报道引发的、奔向不可监控性的竞赛。我们现役前沿模型(包含 Astra)的计算图深度,在 GPT-4 的两倍以内。」
同一天,Sebastian Raschka 在他的博客贴出一篇技术澄清,直说 looped transformer 没那么玄。独立研究者 Rauno Arike 在 LessWrong 发表一篇逐项拆解,把「该担心」与「不该担心」的理由分开列。
9 月 3 日:Fortune 与 Transformer 陆续整理报道。同一天,中文圈开始出现「AI 推理彻底消失」「人类完全读不懂」这类标题。
从第一则报道到第一份技术澄清,中间隔不到 24 小时。但传到中文圈的,多半只有前半段。
什么是 looped transformer?它跟 neuralese 差在哪?
先讲清楚机制,后面的判断才有地基。
一般 Transformer 处理一个 token 时,信息从第一层依序流到最后一层,每层各有一份自己的权重,跑完就输出。Looped transformer 的做法是让其中一叠层被重复使用:跑完一轮,把输出再馈回同一叠层跑第二轮,跑够了才往下走。
Raschka 用开源模型 Nanbeige 4.2 举了个具体例子。它把 22 层的层堆跑两次,等于得到 44 层的深度,但因为权重共用,存储空间还是 22 层的量。代价是运算量接近两倍。这个技巧在学界至少从 2023 年就有人做,NeurIPS 的 Mixture-of-Recursions 论文还进一步加了一个路由器,让简单的 token 少绕几圈、困难的多绕几圈。
Neuralese 是另一件事。它指的是模型几乎完全在高维潜在空间里推理,中间不产生任何人类可读的步骤。用比喻来说:思维链是你解题时把每一步写在草稿纸上,neuralese 是全部心算、只报答案。
Raschka 那篇的关键一句是:重复使用层本身不会压掉可见的思维链,它只是在输出下一个 token 之前多做一些隐藏状态的运算,跟一般 Transformer 的层在做的事同类。他也直接写道,把模型加大(例如从 GPT-5.6 Luna 升到 Sol)会产生同样的效果。
换句话说,两者都会让更多运算留在文字之外,但 recurrent depth 往那个方向移动的距离小得多。
Pachocki 说的「GPT-4 的两倍以内」是什么意思?
这句话是这次争论里信息量最大的一句,也是最容易被略过的一句。
「深度」在这里指的是模型在必须写下点什么之前,一次能想多远。
先用一句白话挡掉最容易的误会:这里讲的是「多算几层再吐出下一个字」,不是「多写几段草稿」。深度算的是每生出一个字之前底层堆叠了几层运算,跟草稿的长度是两回事。草稿可以拉得很长,而每一步的深度仍然很浅。推理模型正是靠「每步很浅、但步数很多」在撑长推理。
GPT-4 是 2023 年的模型,它一次想不了太远,这正是后来的推理模型必须靠写草稿撑住长推理的原因。如果 Astra 每一步的计算深度最多只有 GPT-4 的两倍,代表它仍然得把大部分推理写下来。
Rauno Arike 据此推估:Astra 的循环次数大约是三到四次。他的推理是,一个 looped 推理模型的单层堆大概比 GPT-4 浅一些,但不会浅超过两倍。
这个估计没有经过 OpenAI 证实。但它是目前公开信息下最具体的一个数字,而且它跟 The Information 自己报道的「OpenAI 限制了使用程度」是相容的。
中文圈的报道放大了哪三处?
我读了几篇中文报道,其中一篇的标题是〈OpenAI Astra 神经语揭秘:高维向量思考让 AI 推理彻底消失〉。内容不能说全错,它甚至在后段自己写了「Astra 用的是循环深度,不是完全的神经语」。问题出在放大的比例。
第一处,标题与内文互相矛盾。 标题断言 Astra 用神经语思考、推理彻底消失,内文却承认 Astra 用的是循环深度、而 OpenAI 明确否认转向 neuralese。一篇文章里两个相反的结论,多数读者只会记得标题那个。
第二处,Huginn 那句话的两个数字都失真了。 那篇写道,马里兰大学的 Huginn 模型「用 35 亿参数、循环 50 圈,打出接近 500 亿参数模型的效果」。
回到论文摘要原文:模型是 3.5B 参数、训练 800B tokens,效能提升「up to a computation load equivalent to 50 billion parameters」。这句话讲的是运算负载的等值。一个 3.5B 的模型多绕几圈之后,吃掉的运算量可以逼近 50B 模型的量级;它在各项评测上表现得如何,是另一个问题,摘要并没有宣称两者相当。
圈数也对不上。依 Rauno Arike 的整理,Huginn 训练时最多用到 32 圈、测试时外推到 64 圈。50 这个圈数我在论文摘要里找不到对应,它可能来自内文某张图,也可能是转译时跟前面那个 50 混在一起。我不打算猜。
能确定的是:一句讲运算成本的话,被读成了一句讲能力的话。而能力的宣称,份量比成本的宣称重得多。
第三处,趋势的方向没有它说的那么确定。 那篇的隐含结论是循环次数会一路往上飙。
我原本想引一串「规模越大、圈数反而越少」的对照去反驳它。材料来自 Rauno Arike 那篇里由模型代为汇整、他自己注明大多没有逐篇读过的文献回顾。后来我把那批论文的摘要逐篇调出来看,那串圈数在摘要里一个都找不到。
摘要写的是别的事。Loopie 的作者开宗明义说,这个领域长年的难题是「在同等预训练运算量下,把参数翻 N 倍通常胜过把模型绕 N 圈」,而他们这篇的贡献就是要突破这个限制。Fu 等人那篇处理的是圈数一多训练就不稳的问题,同时明讲「圈数可以在推理时调整」是这个架构的天然机制。
换句话说,2026 年这批论文在做的事,是让更多圈变得可行。
所以我不能说那篇中文报道把趋势讲反了。我只能说:它把一个还在被积极推翻的限制,写成了既定的下坡路,而它引来当证据的 Huginn,本身并不支持那个结论。
这一段是我自己踩到的坑,顺便留在这里。我拿别人请模型整理的文献回顾当证据,去指认别人引用不实。回查之后那串数字站不住,差别只在它没有进到最后的版本。
一个反直觉的发现:循环架构可能比较好解读
这一段在中文报道里完全没有出现。
在 Rauno Arike 那篇的留言区,有两位做过相关实验的研究者提到同一件事:如果模型被训练成可以用不同的循环次数运作,那么每一圈结束时的中间状态,本身就必须是一个能被解码成合法 token 的状态。因为在训练分布里,那一圈随时可能就是最后一圈。
这个约束在一般的深层 Transformer 里不存在。第 37 层的中间状态没有义务长得像任何一个字。
其中一位研究者在 Ouro-2.6B 上实测后补充:超过 95% 的 token 在每一圈的输出都相同,而那些会变的 token,正好标示出模型真的用上额外深度的位置。他也说明,这比不上完整的思维链,因为你只拿得到单一 token 层级的读数,读不到一段连贯的推理。
这里有个前提要讲清楚:整个性质建立在「模型被训练成能用不同圈数运作」之上。如果 Astra 用的是固定圈数、中间那几圈从来不必独立输出,这个性质对它就不成立。Astra 属于哪一种,目前没有公开信息。
所以我不会把这段当成安心的理由。但它示范了一件事:把「架构变复杂」直接等同于「更不透明」,是一个没有经过验证的直觉。
那真正该担心的是什么?
拆完误读,剩下的部分仍然值得担心,只是担心的位置跟中文报道讲的不同。
先说为什么这条线这么多人在守。2025 年有一篇由 OpenAI、Anthropic、Google DeepMind 研究者共同参与的论文,把思维链的可读性描述为一个难得但脆弱的安全机会,并呼吁业界研究如何保住它。它脆弱的原因就在于,它是训练过程的副产品,没有任何机制保证它会一直存在。
这里要先挡掉一个很自然的反问:如果多绕几圈的效果跟把模型加深加宽同类,那把圈数调大不就等于换一个更大的模型吗?为什么没人管加大模型叫旋钮?
Rauno Arike 给了一个我认为站得住的区分。把模型加深,成本落在预训练:要重跑一次昂贵的训练,而且训练完之后深度就固定在那里,推理时加不了。循环架构不一样,可以用低圈数训练,之后靠少量微调、甚至零样本,就在推理时把圈数往上调。
同样是变深,一个要重新训练一次,一个改一个推理参数就好。旋钮这个字指的是后者。
Greenblatt 在 Pachocki 回应之后补了一段,讲的正是这件事:那则声明与「Astra 存在一个目前设得很低、但可以轻易调高的旋钮」是完全相容的。他接着列出三个他想知道的问题,包括这个架构是否引入了一个新的、天生就很适合大幅放大的深度参数。
Apollo Research 的 Marius Hobbhahn 讲得更直白:只要更深能换到更强,压力方向就是往更深走。
这里有一个滑坡的形状:每一步都不算特别危险,走完一段之后回头看,离出发点已经很远了。这也是为什么有人主张第一步就不该踏出去。
还有一层,我认为对台湾的读者更实用。OpenAI 政策团队 Strategic Futures 的负责人 Dean Ball 一边驳斥这波恐慌,一边指出整个产业是在社群平台的时间轴上,判断一项技术复杂的说法,而几乎没有任何可对照的事实基础。他的结论是:这正是需要法定独立审计与技术评估的理由。
Transformer 那篇文章的留言区有位读者补了一个具体的参照点,我回查法条原文后确认对得上:欧盟 AI 法案附件十一第一节第 1 点 (d) 要求通用模型提供者记载「架构与参数量」(the architecture and number of parameters),第 2 点 (b) 要求记载关键设计选择及其理由与假设;具系统性风险的模型另受第二节第 3 点约束,要提交系统架构的详细说明,交代各软件组件如何彼此衔接。
所以规范是有的,落差在谁看得到。那份文件交给的是 AI Office,不会公开给读者。一位首席科学家在 X 上引用的深度数字,跟一份送交主管机关的技术文件,是两种不同性质的东西。
读不到的东西,就管不到
我自己的工作流里有一小块会被这件事直接影响。
我平常会把同一份代码或同一份分析,同时丢给几个不同厂商的 agent 各自审一遍,再把它们的分歧摊出来自己判断。这套做法能成立,唯一的原因是它们愿意把理由写成我读得懂的字。它们的结论我未必信,但我至少能看到它们是怎么走到那个结论的,然后决定要不要接受。
如果哪天这些 agent 之间改用一种对彼此更有效率、对我不可读的格式互传,我这套交叉验证就会退化成投票:我只剩下数几票赞成、几票反对,看不到理由。这跟我在前一篇里写的「连要求它解释这个最基本的监督手段都失去了」是同一件事,只是缩小到一张桌子的尺度。
所以我对这次的判断是这样:neuralese 没有发生。发生的是另一件事,模型多了一个控制推理深度的旋钮,而外界没有任何管道知道它现在停在哪一格,只能听厂商说。
我在〈Neuralese 是什么〉里写的那句「主要 AI 公司尚未在前沿模型中正式实作 Neuralese CoT」,严格说起来现在仍然成立。
需要更新的是后半段:这件事现在已经不再是「有没有做」的二元问题,而是「做到什么程度、谁有权查、查完给谁看」的问题。
而这三题,目前一题都没有答案。
想看这条线上的其他讨论,可以往「智能与秩序 → AI 治理」走。
💬 留言讨论
加载中...