TL;DR:Looped transformer 就是把同一叠层重复跑。ICLR 2025 有一篇论文在其设定下证明,绕 T 圈足以模拟 T 步思维链,差别在于后者每一步都留下文字。圈数目前没被调大,原因是训练会不稳,而 2026 年有三组工作正在把那些不稳修掉。Fu 等人的摘要直接把「圈数可在推理时调整」写成优点,这正是安全研究者说的那个旋钮。
上一篇写 Astra 那场争论的时候,我犯了一个错。
我引了一串「规模越大、圈数反而越少」的对照,用它去反驳中文报导「圈数会一路飙」的说法。那串数字来自一篇 LessWrong 文章里由模型代为汇整的文献回顾,作者自己注明那批论文他大多没有逐篇读过。
后来我把那七篇的摘要逐篇调出来看。那串圈数,摘要里一个都没有。
这句话要讲精确:我查的是摘要,不是全文。那些数字可能写在正文或附录里,我没有排除这个可能。我能确定的只有一件事,它们没有出现在作者选来代表这篇论文的那段话里。
而摘要写的事情,跟我原本想主张的方向对不太上。下面第三、第四节就是那些内容。
这篇是那次回查的结果。
循环的 Transformer 到底在重复什么?
先把机制讲到够细,后面每一段都靠它。
一般 Transformer 处理一个 token 时,信息从第一层流到最后一层,每层各有一份自己的权重。48 层就是 48 组不同的参数,跑完一次,输出下一个字。
Looped transformer 换了一个做法:让其中一叠层被重复使用。跑完一轮,把输出馈回同一叠层跑第二轮,跑够了才往下走。同一组权重被造访很多次。
开源模型 Nanbeige 4.2 是个干净的例子。它把 22 层的层堆跑两次,等于得到 44 层的深度,但因为权重共用,存储空间仍然只有 22 层的量。代价是运算量接近两倍。Sebastian Raschka 在他的技术笔记里提到,Nanbeige 的研究者发现两次是最好的取舍,跑更多次几乎没有增益,训练却慢得多、贵得多。
既然重复用层在效果上接近把层数加倍,「绕几圈」这个数字实际上就是「这个模型有多深」的另一种写法。它是深度本身,不是一个附加设置。
但要先把两种情况分开,后面的推论才不会滑掉。Nanbeige 是在训练时就把圈数固定成两次,展开深度写死了,跑起来跟一个 44 层的模型没两样。另一种做法是把模型训练成能用不同圈数运作,圈数在推理时才决定。只有后者才配叫旋钮。这两种都存在,而 Astra 属于哪一种,目前没有公开信息。
绕圈跟写草稿,是同一件事的两种做法吗?
Saunshi 等人在 ICLR 2025 发表的〈Reasoning with Latent Thoughts〉提出一个比较强的主张:很多推理问题需要的是深度,参数量没那么要紧。他们的实验结果是,k 层绕 L 圈的性能接近 kL 层不绕圈的模型,而且明显好过 k 层只跑一次。
关键在后半段。他们在论文的设定下证明,looped 模型会隐式地产生潜在思考,绕 T 圈足以模拟 T 步的思维链。他们也观察到,looped 与非 looped 模型的扩展行为都取决于有效深度,形态类似思维链在推理时的扩展。
要注意这个结果的方向。它说的是绕圈能模拟草稿,不是说两者等价、可以自由对调。但单向就够用了:模型要多想几步,可以把想法写成文字再读回去,也可以在同一叠层里多绕几圈,而后面这条路走得到前面那条路的地方。
差别在于,写下来那条路的每一步都留下人看得懂的字。
思维链之所以能被监控,从来不是因为有人设计了监控机制。它能被监控,是因为模型当时只有那一条路可以走。
这正是〈Neuralese 是什么〉那篇在担心的事。当时的问题是 AI 会不会发展出一种不写成文字的思考方式;Saunshi 这篇的结果说明,那条路在架构上本来就存在。
绕圈到底划不划算?学界吵的是这一题
中文报导把「圈数会一路飙」写成既定趋势。但学界真正在吵的问题,比那个具体得多。
Loopie 论文(〈Loop the Loopies!〉,2026 年 7 月)的摘要开宗明义:这个领域长年的难题是,在同等预训练运算量下,把参数翻 N 倍通常胜过把模型绕 N 圈。
一句话讲完了为什么过去十年没人这样做。不是没想到,是不划算。
Loopie 的贡献就是宣称处理了这个难题。它是两个 Mixture-of-Experts 模型,20B 参数中 2B 活跃,以及 6B 中 0.6B 活跃。作者说在相同运算预算下,它明显胜过一般 Transformer 的基线,并在 2025 年的国际数学奥林匹亚与物理奥林匹亚达到不用工具的金牌等级表现。
Ouro(〈Scaling Latent Reasoning via Looped Language Models〉)的结果指向同一件事。1.4B 和 2.6B 的模型,训练 7.7T tokens,在多项评测上追平最高到 12B 的当代模型。作者通过对照实验说明,这个优势的来源是知识操作能力变好,知识容量并没有跟着变大。
所以那句「多绕圈划不划算」,2026 年的答案正在从「不划算」翻过来。
那圈数为什么还没被一路调大?
因为训练会坏掉。而这是工程问题,不是物理上限。
Fu 等人的〈Simply Stabilizing the Loop via Fully Looped Transformer〉把病因写得很清楚:圈数一多,训练不稳定,来源有两个,梯度震荡与残差爆炸。他们提出两个不增加参数的修法去压住它。
DeepLoop(〈Depth Scaling for Looped Transformers〉)从另一个角度处理同一件事。用白话讲:圈数一多,同一批权重会被重复造访,梯度叠加得太猛,所以必须更用力把残差压小。论文的推导是,一般 Transformer 的每个残差分支各自收到自己的参数更新,循环架构却是同一份共用的更新聚合了重复造访累积的梯度,下一轮又被同一批造访读回去;在保守情况下,残差缩放的指数必须从四分之一提高到二分之一。另外还有一篇 Parcae 在做循环语言模型的稳定扩展律。
把这几篇摆在一起:光是处理训练稳定性,2026 年就有三组不同的工作在推同一扇门。
这跟「圈数在往下走」是两个不同的故事。
圈数到底是不是一个旋钮?
安全研究者把它叫做旋钮,OpenAI 那边没有直接否认。但最干脆的一句话,其实是研究者自己写的。
Fu 等人那篇摘要,在讲完 looped transformer 的好处之后接了一句:由于圈数可以在推理时调整,它也提供了一个平衡性能与测试期运算的天然机制。
这句话是当成优点写的。它跟 Ryan Greenblatt 担心的「一个目前设得很低、但可以轻易调高的旋钮」,讲的是同一个东西,只是立场不同。(Greenblatt 是 AI 安全研究者,这场争论起于外界怀疑厂商可以在不公开的情况下把不可见的推理深度往上调。)
一项架构特性同时是研发端的卖点和安全端的隐忧,这在 AI 领域不算罕见,但很少像这次一样,两边用的几乎是同一句描述。
要补一个限定:这种可调性需要模型本来就被训练成能用不同圈数运作。一个以固定圈数训练出来的模型,推理时乱改圈数会坏掉。所以旋钮的存在是一个训练期的选择,不是所有循环模型天生都有。
Ouro 带来的是更进一步的版本。它的训练目标里有一个熵正则化项,用来学习深度分配;换句话说,那是一个会逼模型省着用计算步数的惩罚项,于是绕几圈变成模型自己学会针对不同输入去决定。
如果这条路走通了,旋钮就不在人的手上了。它会被编进训练目标里,而外界要查的东西,从「你把参数设成几」变成「你的模型学会了什么样的深度策略」。后面那个问题难查得多。
绕圈的模型比较好读,还是比较难读?
这一题目前没有定论,而定论之所以要紧,是因为它决定现有的监控工具还能撑多久。
支持「比较好读」的有三组线索。
Ouro 论文自己宣称,LoopLM 产生的推理轨迹跟最终输出的对齐度,高于显式思维链。显式思维链的老问题正是模型嘴上说一套、实际算另一套,而 Ouro 给的数据指向绕圈的轨迹在这件事上表现更好。
LessWrong 上有两位做过相关实验的研究者提到,如果模型被训练成能用不同圈数运作,那么每一圈结束时的中间状态,本身就必须维持在能被解码成合法 token 的状态,因为那一圈随时可能就是最后一圈。一般深层 Transformer 的第 37 层没有这个约束。其中一位在 Ouro-2.6B 上自陈实测,超过 95% 的 token 每一圈输出都相同,而那些会变的 token 刚好标出模型真的用上额外深度的位置。这个数字我没有独立覆核,它来自留言区的个人实验。
反方的说法也有分量。有人指出循环架构的表达力比同等深度的一般 Transformer 更高,某些操作它能隐式学会而一般架构学不会,这让监控更难。Rauno Arike 的回应是,权重绑定其实是一种限制,k 层绕 L 圈是 kL 层模型的一个特例,函数空间更小而不是更大。
这场交锋还没收尾。但它至少说明一件事:把「架构变复杂」直接等同于「更不透明」,是一个没有经过验证的直觉。
「我们限制了使用程度」算不算一个承诺?
把前面几节收在一起,治理的问题就浮出来了。
圈数等于深度。深度可以在推理时调整。调大它划不划算,学界的答案正在翻转。而模型可能自己学会决定要绕多深。
在这个背景下,一家公司说「我们限制了这项技术的使用程度」,这句话能不能被当成承诺?
Geoffrey Irving 给了一个具体的判准。他说他请教过电路复杂度的专家,共同的意见是:要从限制电路深度里拿到有意义的保证,你得把深度压得非常低。如果界线是「几百层」或者「我们偶尔会吐一个 token」,那是个假约束。他用了一个对照:这相当于说「我们有监控思维链」却不讨论错误率。现实是按数字分级的,不是按「我们试过了」这种二元判断。
这个判准在企业场合直接可用。任何形态的控制措施,只要它的叙述里没有数字和误差,它就还不是一个可以被稽核的东西。
Greenblatt 在 OpenAI 首席科学家 Jakub Pachocki 回应之后追问的三件事,走的是同一条路:有没有现成的方式可以用高很多的深度去部署它;这个模型在不可见推理能力上是不是一次超出趋势的跳跃;这个架构有没有引入一个天生就很适合大幅放大的深度参数。
三个问题问的都是刻度。
这条纪律我在小得多的规模上实作过,而且只在方法论这一层可以类比。我让一批排程每天检查自己的系统,但真正在把关的那几支,做的事情是拿一份写死的契约文件,逐条打线上的实际回应,比对状态码对不对得上,而不去问系统「你还好吗」。状态码是确定性的,神经网络的不可见推理不是,稽核技术本身完全不能平移。能平移的只有一句:验证标准不能来自受检者的自陈。这是任何稽核的第一课,只是在 AI 这一层还没有被制度化。
没有刻度的旋钮
我对这批论文的判断是这样。
Looped transformer 不神秘,它是一个工程上很合理的选择。它现在圈数不多,是因为训练还不够稳,不是因为有人在守着它。而那些不稳,正在被五组不同的人同时修。
安全研究圈这波反应之所以那么大,我认为关键不在 Astra 这次做了什么,而在大家看懂了这条路的形状:一个既是卖点又是隐忧的参数,一个可以在训练时就决定要不要留给推理期去调的深度,以及一个目前只能靠厂商自陈的查核链。
至于刻度该由谁读、读到什么精度、读完的记录留在哪里,这三题我在上一篇结尾写过还没有答案。
回查完七篇摘要之后,我要补上第四题:连论文自己写了什么,都要有人真的去读。这一题的门槛最低,而我上一篇就是在这里出的错。
想看这条线上的其他讨论,可以往「智能与秩序 → AI 治理」走。
💬 留言讨论
加载中...