网易首页 > 网易号 > 正文 申请入驻

人类研发时代结束?XYZ最强Search Agent横扫七大榜单,300个Agent跑通AI4AI全栈闭环

0
分享至

近日,XYZ AI Lab正式发布两款 Deep Search Agent:35B 参数规模的XYZ-Aquila-mini与 397B 参数规模的XYZ-Aquila-pro,并刷新多项 Deep Search 评测的 SOTA 成绩。



图 1:XYZ-Aquila-mini 与 XYZ-Aquila-pro 在六项公开展示评测中的成绩对比。

成绩之外,更值得关注的是它们背后的研发方式。XYZ-Aquila-mini 与 XYZ-Aquila-pro 并非只来自传统研发流程中的单点优化,而是 XYZ 团队对一种新型AI4AI 研发范式的系统性探索:让 AI 不再只是被训练和改进的对象,也开始驱动完整 Agent 系统的研发闭环。

让 AI 参与改进 AI,正在从一个富有想象力的命题,成为前沿实验室集中投入的研发方向之一。这一方向通常被称为AI4AI;更进一步的讨论,则指向RSI(Recursive Self-Improvement,递归自我改进)。当前前沿 AI 竞争的焦点,已经不只是如何训练出更强的模型,也包括如何让模型参与算法发现、代码开发、实验迭代,以及下一代 AI 系统的构建。

这场变化已经进入真实研发流程。Google DeepMind 的 AlphaEvolve 已被用于数据中心效率优化、芯片设计和 AI 训练流程改进。Anthropic 在 2026 年 5 月披露,其代码库中新合入的代码已有超过 80% 由 Claude 编写。

AI 参与的范围也在继续向核心研究环节延伸。OpenAI 在 GPT-5.6 发布中,将研究调试、Kernel 优化、训练循环改进和后训练优化等任务纳入 RSI Index,用以衡量模型参与 AI 研发的能力;Kimi K3 发布时也披露,在模型开发后期,K3 的一个早期版本承担了团队大部分 GPU Kernel 优化工作。AI 正在从 “被研发的对象”,逐渐成为研发过程中的执行者、实验者和改进者。

但从 “帮助研发” 到 “持续改进一套完整的 AI 系统”,中间仍隔着很长的链路。AI 能够修改代码,并不意味着它能够轻易在数据训练工具上下文评测基础设施彼此耦合的条件下持续找到有效改进,更不意味着这些改进可以被验证复现积累

XYZ 选择验证的,是与 RSI 相关、但在今天已经具备工程可操作性的一部分问题:在目标权限资源验收规则均由人类定义的前提下,AI 能否持续参与一套完整 Agent 系统的研发和改进?

为此,XYZ十余人的核心团队仅用两个月,在千卡级等效算力支持下协同调度超过 300 个Agent Workers,将任务构造、模型训练、运行时优化和评测验证纳入同一套研发系统,以 AI 驱动任务生成、实验执行和反馈迭代。

真正关键的并不是算力或 Agent 数量本身。XYZ 要解决的问题,是如何将大规模计算资源、多 Agent 协作,以及任务构造、模型训练、运行时优化和评测验证整合进同一套研发系统、形成闭环,让海量实验不只是数量上的叠加,而是转化为可验证、可复现、能够持续沉淀经验的研发能力。

  • 完整技术报告:https://xyz-lab.ai/blogs/ai4ai-at-scale/assets/bounded-exploration-ai4ai-system-optimization.pdf
  • 更多信息可在 XYZ AI Lab 官网查看:https://xyz-lab.ai

为什么选择 Deep Search

Deep Search 是 AI4AI 的高压试验场。一次深度搜索通常要经历问题拆解、网页检索、来源判断、跨页面比较、计算、核验和最终作答。网页会失效,搜索结果会跑偏,来源可能冲突,关键证据也可能在长流程中被折叠或淹没。一次回答即使碰巧正确,也不代表中间过程可靠。

在 Deep Search 中,模型只是系统的一部分。任务如何构造、搜索和抓取工具如何返回信息、Python 环境能否保持状态、上下文何时整理、答案生成与提交如何路由、评测环境如何与研发流程隔离,都会改变一条运行轨迹。某项改动在一个模块里看似有效,换一套工具接口或上下文策略后,可能立刻失效。

这也使 Deep Search 兼具两重角色:它既是检验 XYZ-Aquila 最终能力的应用场景,也是对 AI4AI 系统设计能力的压力测试。系统要真正完成一次任务,不是返回十条链接,而是走完 “查 — 读 — 算 — 验” 的长链路,并确保已经找到的关键证据最终被正确写入答案。

多项 Deep Search SOTA 如何理解

XYZ-Aquila 的完整评测数据集包括 BrowseComp、BrowseComp-ZH、DeepSearchQA、GAIA、LiveBrowseComp、Humanity's Last Exam (HLE) 和 WideSearch 七项基准,具体参见 XYZ 技术报告,图 1 中展示六项横向对比。

与同规模系统相比,XYZ-Aquila-mini 在七项基准中均取得最佳结果:BrowseComp 78.8、BrowseComp-ZH 82.9、DeepSearchQA 89.5、GAIA 97.1、LiveBrowseComp 48.7、HLE 51.1,以及 WideSearch 80.8。它的优势不只落在单一题型,而是覆盖中英文网页、时效信息、深度检索和宽域信息收集

目前 XYZ-Aquila-pro 在部分评测集上和 Claude Opus, GPT 等大型闭源模型仍有差异,但其仍在 BrowseComp-ZH、LiveBrowseComp 和 WideSearch 三项基准上取得截至目前的最高公开报告分数,在 DeepSearchQA 上也取得了与 1 TB 的 Kimi-K2.6 持平的成绩。

同样,当前结果证明的是模型、数据、训练、工具、上下文策略、运行时、评测和基础设施共同组成的系统具有竞争力。

SOTA 背后:把设计空间交给 AI,把最终判断留给人

这些成绩背后,是一套将大规模探索交给 AI、同时将规则制定和最终判断保留给人的研发系统。XYZ 将其运行原则概括为一句话:人定规则,AI 找路;独立评测,全程留痕。

人类首先定义研发目标、评测标准、资源预算和风险边界。在此基础上,调度 Agent 将复杂问题拆解为一系列可执行、可验证、可追踪的任务,再交由不同的 Agent Workers 分析失败轨迹、提出候选方案、修改代码或数据,并运行实验。

实验完成后,候选改动不会直接进入下一轮研发或发布配置,而是先由独立评测器(Evaluator)生成可核验的评测证据,再由门控机制(Gate)按照预设标准决定接受、拒绝,或升级至人类审查。整个过程中,每一次实验的方案、过程、结果和判断依据都会被完整记录。

这些记录进一步写入共享记忆。有效改动会沉淀为后续任务可以检索和复用的经验;失败尝试也不会被简单丢弃,其失败原因和适用边界同样会被保留,帮助系统减少重复探索,让每一轮实验都建立在此前经验之上。

这套机制把大规模搜索和实验执行交给 AI,却没有把规则制定和最终决策权交给 AI。Agent 可以在明确授权的范围内自主推进,但不能修改评测标准、读取私有答案,也不能自行批准自己的方案。当系统出现证据冲突、疑似数据泄漏、高风险改动或权限越界时,系统必须暂停自动推进,并将任务升级至人类审查。

因此,300 余个 Agent Workers 并不是 300 个各自决策的 “数字研究员”,而是由统一系统编排、各自承担特定任务的 Agent 执行单元。人类负责确定方向、设定边界和作出关键判断;Agent 则负责问题拆解、方案探索、实验执行、结果汇报和经验整理。

正是通过这套分工,十余名研究人员无需逐一跟进每一次实验,也能将数百个 Agent 和千卡级算力组织成一轮轮可验证可复现能够持续积累的系统性改进。



图 2:有边界的 AI4AI 改进循环。研究、开发、评测和记录形成闭环,每一轮结果都会进入共享记忆。



图 3:人类与 Agent 的三种协作方式:沉淀经验、验证人的候选想法,以及通过阶段报告持续调整方向。

不只是执行实验,AI 开始提出新解法

这套系统的价值,不只在于替人执行更多实验,还在于从大量失败轨迹中识别人类未曾预设的改进方向。下面这个案例,是这一机制如何工作的一个具体切面。

团队在复盘长程搜索时发现,一些 Agent 明明已经找到关键网页,也留下了引用,最后却没有把最重要的信息写进答案。问题不总是 “没搜到”,而是到了作答时,Agent 已经看不见或没有正确使用自己曾经找到的证据:信息可能被折叠进过长的上下文,也可能被大量中间过程淹没。

沿着运行轨迹、上下文变化和最终提交之间的关系,AI4AI 系统提出了两个候选方向。第一,不等上下文接近上限时才被动压缩,而是在状态仍然清晰时让模型主动整理,保留已确认的证据、关键结论、未决问题和下一步计划。第二,为 Agent 增加持续维护的 “研究记事本”,把候选答案、来源关系和中间结论写入独立工作区,再反复回看和交叉验证。



图 4:完整搜索轨迹的 token 长度和工具调用次数均呈明显长尾,上下文管理由此成为长程搜索的核心问题。

这两个方向不是人类团队事先写好的工程清单。AI 从轨迹中提出方案,团队随后完成候选实现和独立评测,检查证据是否真正被保留、最终答案是否正确使用这些信息,以及是否引入新的成本或副作用。其中,主动上下文整理及配套的可回放上下文策略进入当前系统;“研究记事本” 则作为带状态的候选设计和过程经验继续保留。

这件事证明的,不只是自动化提高了实验吞吐量。更重要的是,AI 开始扩展团队实际能够探索的解空间(solution space):它能从海量实验轨迹和失败模式中发现超出人类预设候选范围的新方案,再把这些方案送入同一套评测和验收流程。

从单点发现,走向系统级优化

主动整理只是 AI4AI 优化循环的一个切入口。沿着失败轨迹继续追问,问题往往并不局限于某个具体答案,而会逐渐暴露在任务设计、训练过程、工具交互、运行时状态以及强化学习策略等多个环节。XYZ 的 AI4AI 并不是围绕单个 checkpoint 进行局部调参,而是在一组彼此耦合的系统设计面上寻找可验证的改进。

任务构造:让题目考察搜索能力,而不是记忆能力。系统从可靠来源构建证据图,通过链接、引用、共享实体和时间关系连接网页,再生成问题、答案、支持路径和约束。只有满足固定工具环境下可检索、答案唯一、来源链可靠,且不存在明显查询捷径的任务,才会进入训练或内部评测集合。

训练:只学习 Agent 当时真正看见的世界。一条成功轨迹可能同时包含网页超时、格式错误、无效重复尝试和后续恢复过程。系统因此保留完整审计日志和每一步的可见状态(visible state),训练时重建模型当时实际可获得的信息,仅监督有效推理、工具调用和最终作答。这套方法被称为状态对齐的监督微调(state-faithful SFT)

运行时:把错误定位到具体环节。XYZ-Aquila 在统一接口下调用搜索(search)、抓取(scrape)和 Python 工具。系统通过只增不改的审计日志(append-only audit log)逐步可见状态,使团队能够区分不同类型的问题:是证据从未被找到,还是证据已经存在但没有被正确呈现,或者 Agent 已经获得证据却未能将其用于最终回答。

强化学习:从局部奖励走向长程决策。对于 Deep Search 这类长程任务,真正重要的并不是模型是否能够完成某一次搜索,而是它能否在多轮环境交互中持续做出合理决策,并维护一条可靠的证据链。强化学习正是团队用于探索这一能力的重要工具。在 AI4AI 流程中,团队先用低成本筛选快速识别有潜力的训练策略,再将完整的 RL 训练和端到端评估投入到证据更充分的方向上。当前的探索包括利用过程奖励改善长程任务中的信用分配,以及在上下文管理机制下,通过复用共享前缀来提升训练效率。这些机制帮助团队更高效地研究长程搜索能力,同时也让每一轮实验结果能够反馈到下一轮系统优化中。

Deep Search 不是终点

对 XYZ AI Lab 来说,Deep Search 只是 AI4AI 研发体系的第一个公开验证场。它同时具备足够的复杂性和可观测性:一方面,它能够暴露数据构造、训练方法、工具使用、上下文管理和运行时决策之间的系统耦合问题;另一方面,每一次探索都会留下可回放、可验证、可审计的完整轨迹。

基于 AI4AI 范式研发出来的 XYZ-Aquila 想要证明的,并不是复杂 Agent 的研发难度凭空消失,而是这种复杂性可以被重新组织:AI 承担高吞吐的探索、执行和经验整理,人类则将注意力集中在目标、边界和关键判断上;算力的价值也不再只是产生更多实验,而是被组织成更多可验证、可拒绝、可积累的研发循环。

从更长远的视角看,RSI(Recursive Self-Improvement)讨论的是 AI 是否能够参与构建更强的 AI,而 XYZ-Aquila 展示的是这一方向在当下阶段的一种可验证实现:AI 可以驱动 AI 研发闭环,帮助探索新的改进路径,但仍必须在明确规则和独立验证机制下运行。它不能自行修改评测标准,不能访问受限信息,也不能批准自身进入发布流程。

Deep Search 上取得的多项领先成绩,是这套 AI4AI 研发体系目前最直接的外部验证,也是 XYZ AI Lab 面向下一阶段探索提交的第一份公开答卷。未来,这套方法有望进一步扩展到 Coding Agent、通用多工具 Agent,以及法律、医学、科研和企业工作流等更广泛场景。任务形式会变化,但底层闭环保持一致:提出候选方案、执行实验、独立验证结果、沉淀经验,并将经过验证的改进带入下一轮探索。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
错失詹姆斯之后,热火与勇士开启争夺战,角逐这名未来名人堂球星

错失詹姆斯之后,热火与勇士开启争夺战,角逐这名未来名人堂球星

夜白侃球
2026-07-25 14:41:47
外网彻底看不懂了:中国卖不掉的西瓜,为什么最后全城都在买?

外网彻底看不懂了:中国卖不掉的西瓜,为什么最后全城都在买?

郭蛹包工头
2026-07-24 18:25:20
别再同情邹市明!被老婆娘家吸干血包的他,也是一只白眼狼

别再同情邹市明!被老婆娘家吸干血包的他,也是一只白眼狼

秋姐居
2026-07-21 09:25:51
春秋航空:接受批评,全面整改;此前国航、南航、东航、海航、厦航、吉祥航空、春秋航空等被约谈

春秋航空:接受批评,全面整改;此前国航、南航、东航、海航、厦航、吉祥航空、春秋航空等被约谈

大象新闻
2026-07-24 20:52:20
71岁敬一丹近况曝光 状态完全超出想象

71岁敬一丹近况曝光 状态完全超出想象

喜欢历史的阿繁
2026-07-25 02:13:56
“你就是一普通中年妇女,装什么嫩啊!”女子伪装儿子女友被喷!

“你就是一普通中年妇女,装什么嫩啊!”女子伪装儿子女友被喷!

世界圈
2026-07-13 12:38:30
王诗龄近照大变样,170cm酒杯腿火了!刷屏全网:这姐,美出巅峰了...

王诗龄近照大变样,170cm酒杯腿火了!刷屏全网:这姐,美出巅峰了...

老吴教育课堂
2026-07-24 12:25:44
翻车40岁陕西大叔奔现31岁川妹子同居5天直呼扛不住精力太旺盛

翻车40岁陕西大叔奔现31岁川妹子同居5天直呼扛不住精力太旺盛

有态度网友19Dsym
2026-07-23 05:33:08
詹姆斯落地后还有5条大鱼!哈登追梦将留队,德罗赞成勇士头号目标

詹姆斯落地后还有5条大鱼!哈登追梦将留队,德罗赞成勇士头号目标

锅子篮球
2026-07-25 14:46:41
影响中!台风“红霞”已“开眼”!登陆点在惠东或海丰附近沿海

影响中!台风“红霞”已“开眼”!登陆点在惠东或海丰附近沿海

声情专递
2026-07-25 15:01:14
中山大学校友会祝贺邓煜,“父母是校友伉俪”

中山大学校友会祝贺邓煜,“父母是校友伉俪”

南方都市报
2026-07-24 20:06:55
被传卷走 18 亿遗产五月,好友曝光翁帆近况,杨振宁当年所言不假

被传卷走 18 亿遗产五月,好友曝光翁帆近况,杨振宁当年所言不假

南万说娱26
2026-07-23 12:45:13
“羌族双煞”杨迪:一年录108档节目,他可不是只凭一张嘴

“羌族双煞”杨迪:一年录108档节目,他可不是只凭一张嘴

飘飘然的娱乐汇
2026-06-03 09:20:15
曝演员片酬从2亿降到最高2500万

曝演员片酬从2亿降到最高2500万

手工制作阿歼
2026-07-23 16:58:36
“越穷越爱折腾这些”,陪读妈妈排队露天炒菜,网友:比90年代还苦

“越穷越爱折腾这些”,陪读妈妈排队露天炒菜,网友:比90年代还苦

熙熙说教
2026-07-25 15:48:26
别犯傻!革命卫队再冲动,伊朗就真要步南联盟的后尘了

别犯傻!革命卫队再冲动,伊朗就真要步南联盟的后尘了

民间胡扯老哥
2026-07-25 06:38:20
黄晓明被曝投资1亿炒股,暴赚100亿,比他拍一辈子戏赚得都多?

黄晓明被曝投资1亿炒股,暴赚100亿,比他拍一辈子戏赚得都多?

小椰的奶奶
2026-07-25 11:39:14
雷军回应小米澎程要打爆增程市场!

雷军回应小米澎程要打爆增程市场!

鞭牛士
2026-07-25 09:41:13
穆里尼奥彻底白忙活!皇马头号王牌铁心离队,利物浦坐等免费捡漏

穆里尼奥彻底白忙活!皇马头号王牌铁心离队,利物浦坐等免费捡漏

奶盖熊本熊
2026-07-25 04:57:08
“妈妈,我屁股好痒”,妈妈半夜发现女儿小屁屁上竟有“白色粉末”……送医检查后倒吸一口凉气

“妈妈,我屁股好痒”,妈妈半夜发现女儿小屁屁上竟有“白色粉末”……送医检查后倒吸一口凉气

佛山电视台小强热线
2026-07-24 21:42:42
2026-07-25 18:07:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13597文章数 142699关注度
往期回顾 全部

科技要闻

星舰13飞全中!20颗真卫星出舱

头条要闻

老父亲遇初恋后欲离婚分房款 女儿:防住前夫没防住亲爹

头条要闻

老父亲遇初恋后欲离婚分房款 女儿:防住前夫没防住亲爹

体育要闻

拿过两个金球奖,却说它只值10英镑

娱乐要闻

曝谢贤离世内情 难怪王菲缺席葬礼

财经要闻

滥用市场支配地位 携程被罚没51.79亿元

汽车要闻

精致硬汉 吉利银河战舰700是台不一样的方盒子SUV

态度原创

教育
本地
家居
健康
公开课

教育要闻

父母为何成罪人付出的越多越遭嫌弃

本地新闻

跟着影视去旅行:西游篇

家居要闻

2026建博会(广州) 公装联探展交流活动

教你三步快速识别中风

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版