网易首页 > 网易号 > 正文 申请入驻

蚂蚁安全团队新范式Agentic Deep Research,推理能力显著提升

0
分享至

尽管 LLM 的能力与日俱增,但其在复杂任务上的表现仍受限于静态的内部知识。为从根本上解决这一限制,突破 AI 能力界限,业界研究者们提出了 Agentic Deep Research 系统,在该系统中基于 LLM 的 Agent 通过自主推理、调用搜索引擎和迭代地整合信息来给出全面、有深度且正确性有保障的解决方案。

OpenAI 和 Google 的研究者们总结了 Agentic Deep Researcher 的几大优势:(1)深入的问题理解能力(Comprehensive Understanding):能够处理复杂、多跳的用户提问;(2)强大的信息整合能力(Enhanced Synthesis):能够将广泛甚至冲突的信息源整合为合理的输出;(3)减轻用户的认知负担(Reduced User Effort):整个 research 过程完全自主,不需要用户的过多干预。

现存最先进的 Agentic Deep Research 系统往往基于由可验证结果奖励指导的强化学习训练,尽管该训练范式带来了显著的性能收益,但仍存在以下核心问题:

  • 梯度冲突(Gradients Conflicts):在基于可验证结果奖励的强化学习范式中,即使中间的推理过程或研究策略是有效的,只要最终答案错误,整个推理轨迹都会受到惩罚。这种粗粒度的奖励设计在中间推理步骤与最终答案之间引入了潜在的梯度冲突,阻碍了模型发现更优的推理能力和研究策略,从而限制了其泛化能力
  • 奖励稀疏(Reward sparsity):基于结果的强化学习仅依赖最终答案生成奖励,导致每个训练样本只能提供稀疏的反馈信号。这严重限制了策略优化的效率,因为它增加了对更大规模训练数据和更长训练周期的依赖。

以上两个限制限制了 Agentic Deep Research 系统的性能上线,为决解这两大限制,来自蚂蚁安全与智能实验室团队提出了 Atom-Searcher,进一步推动了 Agentic Deep Research 系统的性能边界。

  • 论文标题:Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward
  • 论文:https://arxiv.org/abs/2508.12800
  • Github: https://github.com/antgroup/Research-Venus
  • Huggingface: https://huggingface.co/dikw/Atom-Searcher

方法介绍

本研究提出了一种创新性的 Agentic Deep Research 系统训练框架 Atom-Searcher,结合监督微调(SFT)与基于细粒度奖励的强化学习构建强大的 Agentic Deep Research 系统。

与现存 Agentic Deep Research 训练框架相比,Atom-Searcher 创新地提出了 Atomic Thought 推理范式,引导 LLM 进行更加深入、可信和可解释的推理;然后引入 Reasoning Reward Model(RRM)对 Atomic Thought 式的推理过程进行监督,构建细粒度的 Atomic Thought Reward(ATR);进而提出一种课程学习启发的奖励融合策略将 ATR 与可验证结果奖励进行聚合;最后基于聚合奖励进行强化学习训练。

Atomic Thought 推理范式

细粒度 Atomic Thought Reward 构建

课程学习启发的奖励聚合策略

基于可验证结果的奖励的 Agentic Deep Research 系统之所以存在梯度冲突问题,是由于基于结果的奖励在 token 级别的奖励分配上过于粗糙。具体来说,它将中间推理步骤的正确性完全归因于最终答案,常常在不考虑各步骤实际贡献的情况下对其进行奖励或惩罚。这种错位在优化过程中会引发梯度冲突。为解决这一问题,我们将 ATR 与结果奖励相结合,利用 ATR 作为辅助信号来校准结果奖励,从而缓解梯度冲突。

然而,使用静态的奖励加权系数无法与训练动态保持一致。具体而言,在训练初期,模型能力尚有限,难以生成完全正确的答案,但更有可能探索出对最终正确解有贡献的有用 “原子思维”。如果此阶段仅依赖基于结果的奖励,这些有益的原子思维可能因最终答案错误而遭到不公正的惩罚;相反,一些有害的原子思维也可能被错误地强化,导致严重的梯度冲突,因而需要 ATR 进行较强的校准。随着训练的推进,模型能力逐步提升,其推理轨迹与正确答案的对齐程度也日益提高。因此,梯度冲突逐渐减弱,而来自 ATR 的过度校准可能会引入不必要的噪声,反而损害最终的准确性。

强化学习训练

基于混合奖励,本文采用了 GRPO 算法进行强化学习训练。并使用了 Loss Masking 策略保证训练的稳定性。具体而言,在原始的 GRPO 框架中,损失函数会计算整个推理路径中所有 token 的梯度。但在 Atom-Searcher 中,模型的输出路径包含由外部环境检索得到的内容(如搜索结果),这些内容不是模型生成的,也不可训练。为了避免模型在训练时被这些静态、不可控的内容误导,本文采用了 Loss Masking 机制,将检索结果部分的 token 排除在损失计算之外。

实验效果

主实验

Atom-Searcher 在 In-Domain 和 Out-of-Domain 上的性能表现均十分亮眼。在 In-Domain Benchmarks (NQ、 TQ、HotpotQA、2Wiki)上 Atom-Searcher 相较于最优 baseline——DeepResearcher 取得了 8.5% 的平均性能提升,在 Out-of-Domain Benchmarks(Musique、 Bamboogle、 PopQA)上 Atom-Searcher 相较于最优 baseline——DeepResearcher 取得了 2.5% 的性能提升。

消融实验

作者们证明了 Atom-Searcher 中 Atomic Thought 范式和 ATR 的贡献,并证明了相较于传统的 < think > 推理范式 Atomic Thought 范式为 RRM 提供了有效的监督锚点,从而带来了性能提升

案例分析

作者们通过案例分析对比了 Atom-Searcher 与最优 baseline——DeepResearcher 的推理过程。展示了 Atom-Searcher 的优势:(1)Atom-Searcher 在其推理过程中自主生成了 Atomic Thoughts,展现出更接近人类的认知行为,例如问题分析、提出解决方案假设、预测错误以及规划下一步操作,使其推理过程更加深入且清晰;(2)Atom-Searcher 会触发更多的搜索调用,从而获取更丰富的外部信息,以确保答案的正确性。这些优势表明,Atom-Searcher 在更复杂的 Deep Research 任务中具有巨大潜力。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
为何 KFC 要几乎强制手机点单?看网友的吐槽:引起万千共鸣

为何 KFC 要几乎强制手机点单?看网友的吐槽:引起万千共鸣

另子维爱读史
2026-09-17 20:41:04
曝哈里斯训练营遭遇左小腿拉伤 将在季前赛结束后进行复查

曝哈里斯训练营遭遇左小腿拉伤 将在季前赛结束后进行复查

北青网-北京青年报
2026-10-05 09:22:05
国庆假期第五天,闹心的事情一件接一件,高速堵车只是冰山一角

国庆假期第五天,闹心的事情一件接一件,高速堵车只是冰山一角

莹莹的历史说
2026-10-05 03:30:56
日本197人专案组连夜抓捕驻日美军20岁上等兵,涉嫌抢劫杀人后闲逛,在娱乐区被捕

日本197人专案组连夜抓捕驻日美军20岁上等兵,涉嫌抢劫杀人后闲逛,在娱乐区被捕

红星新闻
2026-10-04 13:14:09
利润暴涨910%!浙江隐形首富靠卖饮料瓶,半年狂入96亿

利润暴涨910%!浙江隐形首富靠卖饮料瓶,半年狂入96亿

莫地方
2026-10-04 17:58:46
世界排名更新!吴宜泽跃居第二直逼赵心童,袁思俊创新高丁俊晖保住前16

世界排名更新!吴宜泽跃居第二直逼赵心童,袁思俊创新高丁俊晖保住前16

世界体坛观察家
2026-10-05 00:05:23
马来西亚一名男子在尼泊尔洪灾中失踪37天后终被找到,已返回家中

马来西亚一名男子在尼泊尔洪灾中失踪37天后终被找到,已返回家中

阿尔卑斯瞭望
2026-10-04 19:55:46
随着丹麦1-0,德国0-0,荷兰2-1,葡萄牙2-1,欧国联最新积分榜出炉

随着丹麦1-0,德国0-0,荷兰2-1,葡萄牙2-1,欧国联最新积分榜出炉

侧身凌空斩
2026-10-05 04:49:33
出汗是血糖最好的反馈!医生:出现这4种出汗,多是血糖快失控了

出汗是血糖最好的反馈!医生:出现这4种出汗,多是血糖快失控了

千金芳儿
2026-10-05 09:05:14
已承认,知名演员夫妻确认离婚!

已承认,知名演员夫妻确认离婚!

财经要参
2026-09-29 16:00:05
奥迪“代步版”A6L上市,价格跌入谷底!

奥迪“代步版”A6L上市,价格跌入谷底!

米粒说车唯一呀
2026-10-04 14:01:54
尴尬了!某汽车厂商2000元邀头部车评人做视频,博主反问怎么养活300人,网友:嫌弃少可以婉拒,挂网上讽刺别人,寒碜的是自己

尴尬了!某汽车厂商2000元邀头部车评人做视频,博主反问怎么养活300人,网友:嫌弃少可以婉拒,挂网上讽刺别人,寒碜的是自己

火山詩话
2026-10-02 08:30:52
《新闻周刊》:俄罗斯喷气式无人机的生产速度令人恐惧

《新闻周刊》:俄罗斯喷气式无人机的生产速度令人恐惧

俄罗斯卫星通讯社
2026-10-03 16:06:26
好险!韩国U23队长只剩9天便要强制入伍,如今将免兵役去留洋

好险!韩国U23队长只剩9天便要强制入伍,如今将免兵役去留洋

懂球帝
2026-10-04 15:41:25
7-0,劳塔罗扛起锋线,梅西退出后,阿根廷2连胜轰11球0丢球

7-0,劳塔罗扛起锋线,梅西退出后,阿根廷2连胜轰11球0丢球

侧身凌空斩
2026-10-04 10:00:23
女单32强定16席:国乒占7席!石洵瑶完胜世界冠军,日本2人晋级

女单32强定16席:国乒占7席!石洵瑶完胜世界冠军,日本2人晋级

乒烧泳球
2026-10-04 21:43:34
蒙嘉慧罕谈原生家庭 父母姊妹全部离世 靠老公郑伊健一句话终结童年阴影 澄清没有移民日本

蒙嘉慧罕谈原生家庭 父母姊妹全部离世 靠老公郑伊健一句话终结童年阴影 澄清没有移民日本

TVB资讯台
2026-10-04 20:17:11
杜汶泽妻子病痛升级!曝肺腺癌转淋巴了,目前已停止接受靶向治疗

杜汶泽妻子病痛升级!曝肺腺癌转淋巴了,目前已停止接受靶向治疗

小徐讲八卦
2026-10-04 10:20:25
告诉你一个坏消息:2026上海深圳已出现4个“怪象”,深思一下

告诉你一个坏消息:2026上海深圳已出现4个“怪象”,深思一下

巢客HOME
2026-10-05 05:55:07
父亲县委书记下马后,老婆和我离婚了,半年后父亲调任市委副书记

父亲县委书记下马后,老婆和我离婚了,半年后父亲调任市委副书记

呆子的故事
2025-09-16 19:01:25
2026-10-05 09:40:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14123文章数 142744关注度
往期回顾 全部

科技要闻

DeepSeek Harness国庆假期上新!

头条要闻

名校"7人轮奸案"震惊全美 女方曾称同意与2人发生关系

头条要闻

名校"7人轮奸案"震惊全美 女方曾称同意与2人发生关系

体育要闻

32胜0负!德约2-1逆转头号种子兹维列夫 第7次晋级中网四强

娱乐要闻

高晓松悄悄复出:官媒没给他留体面

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

家居
旅游
亲子
房产
时尚

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

一日游订单涨4倍:外国游客体验“像本地人一样生活”|国庆消费青观察

亲子要闻

毁掉宝宝专注力的三件事,不要再做啦!

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

十一长假,中产挤爆“旅游兴趣班”

无障碍浏览 进入关怀版