论文《Teach the Magnitude, Not the Direction》提出一个叫 CREST 的框架,专门解决多轮多步大语言模型智能体的信用分配问题。核心做法是分层:每一轮单独拿到验证过的信用,不再把整段任务的成败笼统摊到每一步上。
同一模型当“自教师”
![]()
框架里没有额外引入新的评判模型,而是让同一个模型充当自教师。它只做一件事:对轮内那些不确定的决策,加大学习权重。换句话说,模型自己判断哪些步骤更值得重点学。
教师不能推翻验证器
这里有一条明确的边界:教师只能调节更新幅度,不能推翻验证器的判断。验证器说对就是对,说错就是错,教师无权改方向。论文标题里的“教大小、不教方向”,指的就是这种约束。
整个 CREST 框架把信用分配拆成两层:验证器负责给每轮一个确定的信用,自教师负责在轮内调整学习强度。两者分工清楚,互不越界。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.