同一个预算,同样的任务,只因为换了一种组织方式,执行准确率从45.8%跳到了62.5%。Meta 提出的 RankEvolve,把这件事做成了可复现的流程。
两个AI,互为审查者
![]()
RankEvolve 的核心做法是让 Claude Code 和 Codex 作为独立节点运行,彼此审查、修复对方的改动。研究阶段和门控由一套编译协议约束,不是让模型自由发挥,而是把每个环节卡在既定规则里。
单一最佳产品的准确率是 45.8%,双产品组合在同等预算下做到 62.5%。差距来自互相挑错这个动作本身。
推荐模型上的12次迭代
在开源 HSTU 推荐模型上,这套框架迭代了 12 次。MovieLens-20M 数据集上的 NDCG@10 指标,相比已发表结果提升了 4.48%。
多智能体自动研究框架的价值,不在于单个模型多强,而在于把审查和修复变成流程的一部分。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.