小模型想变聪明,通常的做法是让它"想久一点"——写更长的思维链,生成更多token。但卡内基梅隆大学和牛津大学的一篇新论文指出,模型可以不写更长的推理过程,而是反复改进隐状态,让它在内部多迭代几轮。
论文显示,循环流(looped flows)表明,这些额外的步骤能实打实地提升准确率。也就是说,测试时的算力投入,不一定非要换成更多的输出token。
![]()
隐状态迭代,而不是token堆叠
思路的核心在于:模型可以"想得更久",但思考发生在内部表示上,而不是外显的文字链条上。小模型通过多轮精炼自己的隐状态,推理表现可以更好。
这挑战了一个默认前提——测试时算力增加,等于生成更多token。论文给出的替代方案是,把算力花在反复打磨同一份内部表示上。
问题也随之而来:循环模型在长循环上很难训练。模型可能一直在更新隐状态,但这些更新会变得不稳定,或者干脆不再带来任何帮助。
循环流怎么解决训练难题
循环流的做法是,把每一次更新都当作一个小型去噪任务来训练,同时确保更新后的隐状态对下一次更新仍然有用。
这样一来,模型在推理阶段就能持续改进同一份内部表示,而不是每多一步就偏离方向。训练时的稳定性问题,被拆解成了一个个可控的小任务。
对关注推理成本的人来说,这个方向值得留意:如果隐状态迭代真的能替代长思维链,那么"让模型多想一会儿"这件事,未必需要付出成倍的token开销。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.