字节跳动新论文提出一种叫 Chain-of-Experience 的方法,核心做法是在上下文中保留先前尝试与反馈,而不是把这些内容整理成简洁摘要。
实验数据
![]()
在 6 个数学、编程和知识基准上,自我反馈平均得分 71.0%,高于无反馈迭代求解的 66.8%;使用正确性或执行器反馈可达 79.3%。
方法逻辑
保留完整尝试历史,让模型能参考此前每一步的失败与修正过程,比压缩成摘要更利于后续推理。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.