多轮多步的大语言模型智能体,训练时最头疼的是信用怎么分。一篇新论文《Teach the Magnitude, Not the Direction》给出的答案是:分层处理,每轮单独拿验证器的信用,不让错误在轮次之间串味。
验证器先定方向,教师再调力度
![]()
这个叫 CREST 的框架,把信用分配拆成两层。每一轮先由验证器给出独立信用,然后同一个模型充当自教师,对轮内拿不准的决策加大学习权重。但这里有个硬约束:教师只能调节更新幅度,不能推翻验证器的判断。
为什么不让教师改方向
如果教师既能改幅度又能改方向,验证器的信号就容易被稀释。CREST 的设计相当于把“对错”和“学多少”分开,验证器管对错,教师管学多少。这样多轮智能体在长链条任务里,不会因为某一轮噪声把整体训练带偏。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.