大模型任务跑到一半换模型,不是无缝衔接,而是要付一笔“交接税”。一篇新论文把这个代价量化了出来:强模型接手时,弱模型的历史留得越少,效果往往越好;弱模型接手时,保留强模型的工作记录反而更有利。
接手方不是从零开始
![]()
中途切换模型,接手的一方并不会清空重来。它继承的是另一个模型的推理过程、工具调用、编辑痕迹,还有那些走进死胡同的尝试。这些“非原生轨迹”会直接影响后续表现。
论文标题叫《交接税:大模型智能体中的非原生轨迹延续》,发布在arxiv上,编号2608.24358。核心发现指向同一个结论:交接策略必须看方向,不能一刀切。
方向不同,策略相反
具体来说,往更强的模型切换时,删掉大部分弱模型的历史记录,结果会更好。强模型有能力自己重新推理,弱模型留下的错误路径反而会把它带偏。
反过来,往更便宜的模型切换时,保留强模型的工作成果更划算。弱模型可以站在强模型打好的地基上继续干活,省下从头摸索的成本。
代价的本质是轨迹污染
这笔“交接税”的根源在于:强模型会继承弱模型的错误,而弱模型能继承强模型的有用铺垫。同样的历史记录,在不同方向的交接中价值完全不同。
对工程实践来说,这意味着模型切换不能简单地把上下文原样传递。需要根据切换方向,主动裁剪或保留历史内容,才能把交接损耗压到最低。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.