登录

「有些模型就是不想学?」循环模型为什么越想越错?


速读:」循环模型为什么越想越错?
2026年08月16日 12:

编辑|山辉

十多年前,Ilya Sutskever 说过这么一句话。

「 模 型就 是想学习。 」

Dario Amodei 在采访中转述 Ilya Sutskever 的说法。图源:Dwarkesh Podcast。 Dario Amodei 在采访中转述 Ilya Sutskever 的说法。图源:Dwarkesh Podcast。 只要解决好数据和算力的问题,模型会自己找到学习的方法。

后来发生的事情我们都知道。模型越做越大。训练数据越用越多,算力投入一路上涨,模型能力被一层层解锁。

但当研究者把目光聚焦在 循环网络 和 隐 空 间 上时,一切都变了。

循环模型能够在隐空间中反复计算,按照设想,同一组网络层多运行几轮,模型就能获得更多计算时间,遇到难题也可以多「想」一会儿。

但现实并不如此美好。

不少模型只擅长使用训练时见过的循环深度,如果再让它多算几轮,它就可能开始在错误的路上狂奔。

因此,有人戏言: 有些模型,就是不想学。

靠「多说」来「多想」

点开一个大模型的「深度思考」,你会看到长长的文字。

这里面看上去有很多「废话」,模型总在一边尝试一边推翻,有时候还会说出「我需要重新思考这个问题」。

这展现了模型的推理过程,虽然不能直接当作模型内部的完整计算过程来看,但也说明了,当前 Transformer 解决难题最成熟的办法,就是让模型 一边说一边想 。

因为标准 Transformer 有点像一栋楼层固定的大楼。

信息从一楼进入,依次经过每一层,最后从顶楼出来。无论面对的是  「 1+1 等于几 」 ,还是一道复杂的数学证明,每次生成下一个 Token 时,它走过的网络深度基本相同。

一趟不够怎么办?那就多走几趟。

模型先生成一个 Token,再带着此前的上下文进入下一轮计算。输出越长,同一套网络被调用的次数越多,模型也就多了几次拆解问题、检查答案和修订答案的机会。

这套办法相当好用。它让原本网络深度固定的 Transformer,也能 根据题目难度灵活分配计算量 :简单问题少说,复杂问题多说,实在不行就自己的几个答案来回打架。

不过,这种思考方式也有点不方便。

模型内容存在的是高维连续的隐状态,因为中途必须要「说」,所以许多中间计算也要被组织成一条可以输出的序列。哪怕某些步骤根本没有说出来的必要,模型也得先生成点什么,才能继续往下走。

于是,另一条路出现了。

直接在网络层循环

循环模型的想法很直接。

既然走一遍网络不够,那就 回到某些网络层再走一遍 。每循环一次,模型都会更新一轮隐状态,复用的还是原来那组参数。

主题:模型