清华等高校的最新研究给AI训练领域泼了盆冷水:AI智能体在优化训练计划上能花数小时,却很少意识到计划本身可能有问题。
论文数据显示,在1,338条后训练轨迹中,相邻实验共有3,557个,但其中只有74个(2.1%)真正改变了高层策略。绝大多数迭代都停留在同一方法框架内,只是反复调整数据、超参数等细节。
![]()
加了工具也没用?
研究人员尝试给AI加入实验日志、技能库和评估器,效果确实有:GSM8K提升了12.6分,HumanEval提升了40.8分。但关键问题依旧——这些改进并未触发策略层面的变更。
更扎心的是,即便把推理token增加到2-8倍,AIME 2025上的表现也几乎没带来可靠增益。算力堆上去了,策略没变,结果自然难有质变。
这项研究揭示了一个尴尬现实:AI在"怎么做"上越来越强,但在"该不该这么做"上依然迟钝。训练策略的自我纠错能力,可能比我们想象的弱得多。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.