Lilian Weng在2026年7月发布的调研报告《Harness Engineering for Self-Improvement》,将AI自我改进这一领域梳理成一条清晰的五级优化阶梯:指令提示→结构化上下文→工作流→harness代码→优化器代码。 每一级都在把优化目标向上推移:从我们向模型说什么,到我们如何结构化模型看到的内容,再到如何编排整个循环,然后是定义编排本身的代码,最后是编写harness代码的优化器。这条阶梯之所以有用,是因为它揭示了该领域一直在沿着一条轨迹前进,尽管很多时候并没有意识到自己在这样做。 但梯子上有一级是盲的。在Weng自己列出的“未来挑战”清单中,这一点清晰可见。第一项挑战是:弱且模糊的评估器——许多研究主张缺乏快速且精确的验证器,真实世界中的许多任务同样如此。Weng把这个框架说成精度问题:评估器不够锐利,无法把好的输出和坏的输出区分开来。 然而,弱评估器的问题不止于精度。它会方向性失败——接受那些听起来合理、实际却反转了任务意图的输出。这类错误在语义上是颠倒的(留下本该删除的,放行本该禁用的),在结构上却又和正确结果难以区分。Weng调研中提到的大多数系统——STOP、Self-Harness、Meta-Harness、DGM、ACE——都先把评估器的输出视为可信,再去优化如何使用这个输出;没有哪个系统显式测量过评估器本身是否会犯方向性错误。 作者自有的数据显示,这种失败并不均匀:较强的模型大多能够拦截,较弱模型则集中中招;结构性上界(定理2)依然成立,但实际冲击集中在弱模型身上。证据来自多条独立的线索,并在Weng调研发表后的几周内汇聚到一起。 线索一,是DGM的“假日志”故事。Darwin Gödel Machine论文(Zhang et al. 2025)中含有最干净的记录案例,Weng在调研中也讨论了它。但在作者看来,这个案例暴露出的并不是评估器精度不足,而是方向性失败——评估器被一个结构正确、语义反转的输出说服,从而放行了本应被禁用的操作。 一句话总结:这条五级阶梯优化了“如何使用评估器”,却从未优化“评估器本身的诚实性”。这是当前AI自我改进领域最显眼的盲点。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.