复杂任务为什么越训越崩?一篇新论文给出了一个思路:让模型递归地改写自己的任务轨迹。
这篇论文的标题是《Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite》,发布在 Hugging Face 的论文页面上。从标题看,它要解决的是复杂任务中轨迹扩展的问题,方法核心是"递归自改写"。
![]()
递归自改写是什么思路
按照标题字面理解,模型不是一次性生成完整轨迹,而是对自己的输出进行递归式的重写。每一轮改写都在上一轮的基础上推进,让轨迹逐步扩展、变复杂。
这种做法针对的是复杂任务里轨迹难以规模化的问题。任务越复杂,单次生成的轨迹越容易断裂或走偏,递归改写相当于把一次大跳跃拆成多次小步迭代。
论文页面显示在 Hugging Face 上,说明研究已公开可查。目前公开信息只有标题和链接,具体方法细节、实验数据尚未在素材中展开。
为什么值得关注
复杂任务的轨迹扩展一直是训练里的难点。如果递归自改写这条路走得通,意味着模型可以在不依赖外部标注的情况下,自己把简单轨迹滚成复杂轨迹。
这条推文发布于 10月5日凌晨4:12,目前有 1,830 次浏览。关注度还不高,但方向本身值得盯一下。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.