微软一项新研究引发关注:仅用约3500行端点代理,就能让开源模型在编程任务上的表现大幅跃升。
这项名为 Agent Lightning v1.0 的研究,核心思路是将任意 harness 接入强化学习,用于模型后训练。关键在于,它没有堆算力,而是靠轻量级代码实现。
![]()
效果相当直接:Qwen3.5-9B 在 SWE-bench Verified 基准上,得分从 41.8% 提升至 56.4%,提升幅度达 14.6个百分点。
更值得注意的是训练成本。整个实验仅用了 6K 训练样本和适度算力,就取得了这一成绩。论文已公开发布,意味着这套方法可以被复现和验证。
对开源社区来说,这算是个好消息——用更少的资源撬动更强的编程能力,或许能让中小团队也能玩得起高质量模型后训练。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.