网易首页 > 网易号 > 正文 申请入驻

蚂蚁安全团队新范式Agentic Deep Research,推理能力显著提升

0
分享至

尽管 LLM 的能力与日俱增,但其在复杂任务上的表现仍受限于静态的内部知识。为从根本上解决这一限制,突破 AI 能力界限,业界研究者们提出了 Agentic Deep Research 系统,在该系统中基于 LLM 的 Agent 通过自主推理、调用搜索引擎和迭代地整合信息来给出全面、有深度且正确性有保障的解决方案。

OpenAI 和 Google 的研究者们总结了 Agentic Deep Researcher 的几大优势:(1)深入的问题理解能力(Comprehensive Understanding):能够处理复杂、多跳的用户提问;(2)强大的信息整合能力(Enhanced Synthesis):能够将广泛甚至冲突的信息源整合为合理的输出;(3)减轻用户的认知负担(Reduced User Effort):整个 research 过程完全自主,不需要用户的过多干预。

现存最先进的 Agentic Deep Research 系统往往基于由可验证结果奖励指导的强化学习训练,尽管该训练范式带来了显著的性能收益,但仍存在以下核心问题:

  • 梯度冲突(Gradients Conflicts):在基于可验证结果奖励的强化学习范式中,即使中间的推理过程或研究策略是有效的,只要最终答案错误,整个推理轨迹都会受到惩罚。这种粗粒度的奖励设计在中间推理步骤与最终答案之间引入了潜在的梯度冲突,阻碍了模型发现更优的推理能力和研究策略,从而限制了其泛化能力
  • 奖励稀疏(Reward sparsity):基于结果的强化学习仅依赖最终答案生成奖励,导致每个训练样本只能提供稀疏的反馈信号。这严重限制了策略优化的效率,因为它增加了对更大规模训练数据和更长训练周期的依赖。

以上两个限制限制了 Agentic Deep Research 系统的性能上线,为决解这两大限制,来自蚂蚁安全与智能实验室团队提出了 Atom-Searcher,进一步推动了 Agentic Deep Research 系统的性能边界。

  • 论文标题:Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward
  • 论文:https://arxiv.org/abs/2508.12800
  • Github: https://github.com/antgroup/Research-Venus
  • Huggingface: https://huggingface.co/dikw/Atom-Searcher

方法介绍

本研究提出了一种创新性的 Agentic Deep Research 系统训练框架 Atom-Searcher,结合监督微调(SFT)与基于细粒度奖励的强化学习构建强大的 Agentic Deep Research 系统。

与现存 Agentic Deep Research 训练框架相比,Atom-Searcher 创新地提出了 Atomic Thought 推理范式,引导 LLM 进行更加深入、可信和可解释的推理;然后引入 Reasoning Reward Model(RRM)对 Atomic Thought 式的推理过程进行监督,构建细粒度的 Atomic Thought Reward(ATR);进而提出一种课程学习启发的奖励融合策略将 ATR 与可验证结果奖励进行聚合;最后基于聚合奖励进行强化学习训练。

Atomic Thought 推理范式

细粒度 Atomic Thought Reward 构建

课程学习启发的奖励聚合策略

基于可验证结果的奖励的 Agentic Deep Research 系统之所以存在梯度冲突问题,是由于基于结果的奖励在 token 级别的奖励分配上过于粗糙。具体来说,它将中间推理步骤的正确性完全归因于最终答案,常常在不考虑各步骤实际贡献的情况下对其进行奖励或惩罚。这种错位在优化过程中会引发梯度冲突。为解决这一问题,我们将 ATR 与结果奖励相结合,利用 ATR 作为辅助信号来校准结果奖励,从而缓解梯度冲突。

然而,使用静态的奖励加权系数无法与训练动态保持一致。具体而言,在训练初期,模型能力尚有限,难以生成完全正确的答案,但更有可能探索出对最终正确解有贡献的有用 “原子思维”。如果此阶段仅依赖基于结果的奖励,这些有益的原子思维可能因最终答案错误而遭到不公正的惩罚;相反,一些有害的原子思维也可能被错误地强化,导致严重的梯度冲突,因而需要 ATR 进行较强的校准。随着训练的推进,模型能力逐步提升,其推理轨迹与正确答案的对齐程度也日益提高。因此,梯度冲突逐渐减弱,而来自 ATR 的过度校准可能会引入不必要的噪声,反而损害最终的准确性。

强化学习训练

基于混合奖励,本文采用了 GRPO 算法进行强化学习训练。并使用了 Loss Masking 策略保证训练的稳定性。具体而言,在原始的 GRPO 框架中,损失函数会计算整个推理路径中所有 token 的梯度。但在 Atom-Searcher 中,模型的输出路径包含由外部环境检索得到的内容(如搜索结果),这些内容不是模型生成的,也不可训练。为了避免模型在训练时被这些静态、不可控的内容误导,本文采用了 Loss Masking 机制,将检索结果部分的 token 排除在损失计算之外。

实验效果

主实验

Atom-Searcher 在 In-Domain 和 Out-of-Domain 上的性能表现均十分亮眼。在 In-Domain Benchmarks (NQ、 TQ、HotpotQA、2Wiki)上 Atom-Searcher 相较于最优 baseline——DeepResearcher 取得了 8.5% 的平均性能提升,在 Out-of-Domain Benchmarks(Musique、 Bamboogle、 PopQA)上 Atom-Searcher 相较于最优 baseline——DeepResearcher 取得了 2.5% 的性能提升。

消融实验

作者们证明了 Atom-Searcher 中 Atomic Thought 范式和 ATR 的贡献,并证明了相较于传统的 < think > 推理范式 Atomic Thought 范式为 RRM 提供了有效的监督锚点,从而带来了性能提升

案例分析

作者们通过案例分析对比了 Atom-Searcher 与最优 baseline——DeepResearcher 的推理过程。展示了 Atom-Searcher 的优势:(1)Atom-Searcher 在其推理过程中自主生成了 Atomic Thoughts,展现出更接近人类的认知行为,例如问题分析、提出解决方案假设、预测错误以及规划下一步操作,使其推理过程更加深入且清晰;(2)Atom-Searcher 会触发更多的搜索调用,从而获取更丰富的外部信息,以确保答案的正确性。这些优势表明,Atom-Searcher 在更复杂的 Deep Research 任务中具有巨大潜力。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
震动台湾政坛!蒋友松想要强行迁走两蒋悬棺,他凭什么敢这样做?

震动台湾政坛!蒋友松想要强行迁走两蒋悬棺,他凭什么敢这样做?

人生录
2026-08-19 00:05:17
当麻省理工拒绝王虹

当麻省理工拒绝王虹

必记本
2026-08-18 22:20:04
从江苏高考状元到央企总经理,他因KTV里一个举动被刑拘 | 最新通报

从江苏高考状元到央企总经理,他因KTV里一个举动被刑拘 | 最新通报

星岛记事
2026-08-18 17:59:35
黑人可以,菲佣可以!唯独内地人处处受限,双标该停了

黑人可以,菲佣可以!唯独内地人处处受限,双标该停了

李云飞Afey
2026-08-18 13:48:25
6人全出局!最该被问责的不是林诗栋周启豪,而是躲在背后的那人

6人全出局!最该被问责的不是林诗栋周启豪,而是躲在背后的那人

原梦叁生
2026-08-19 00:36:56
我们都叫错了朱老!他根本不是高考状元,1947年清华自主招生湖南第一,这份成绩单比状元头衔硬核多了

我们都叫错了朱老!他根本不是高考状元,1947年清华自主招生湖南第一,这份成绩单比状元头衔硬核多了

子芫伴你成长
2026-08-18 18:19:38
8月19日,关于2026年上调养老金的通知,官方有正式公布吗?退休人员要注意5件事,别大意

8月19日,关于2026年上调养老金的通知,官方有正式公布吗?退休人员要注意5件事,别大意

小谈食刻美食
2026-08-19 07:49:30
央视出手,云南宰客团灰产曝光!多方暗中勾结,专门坑害全国游客

央视出手,云南宰客团灰产曝光!多方暗中勾结,专门坑害全国游客

北纬的咖啡豆
2026-08-18 10:02:34
新规出台,强制缴纳公积金上热搜,全额社保再加公积金,用工成本高企员工担心工资下降

新规出台,强制缴纳公积金上热搜,全额社保再加公积金,用工成本高企员工担心工资下降

Mr王的饭后茶
2026-08-18 23:44:05
四川长宁县一升学宴突发事故致5人死亡

四川长宁县一升学宴突发事故致5人死亡

界面新闻
2026-08-19 09:01:56
特朗普说不会与伊朗进行任何会谈;伊朗称美国曾考虑对伊使用“委内瑞拉”模式但未得逞;阿联酋宣布暂停与伊朗一切贸易金融往来

特朗普说不会与伊朗进行任何会谈;伊朗称美国曾考虑对伊使用“委内瑞拉”模式但未得逞;阿联酋宣布暂停与伊朗一切贸易金融往来

极目新闻
2026-08-19 08:48:16
放郭德纲一马,等于告诉世界:我们将继续开放,我们将继续拥抱世界

放郭德纲一马,等于告诉世界:我们将继续开放,我们将继续拥抱世界

细雨中的呼喊
2026-08-18 20:47:03
眼镜掉了颗螺丝,宝格丽维修时要求“成对换腿”,旧腿还要收回;消费者不解:我买的难道只是使用权?

眼镜掉了颗螺丝,宝格丽维修时要求“成对换腿”,旧腿还要收回;消费者不解:我买的难道只是使用权?

大风新闻
2026-08-18 19:51:09
台湾拟每人再发1万元新台币,上半年GDP猛增14.15%

台湾拟每人再发1万元新台币,上半年GDP猛增14.15%

桂系007
2026-08-18 19:22:03
男子当街殴打女儿,路人出手被拘200多天

男子当街殴打女儿,路人出手被拘200多天

中国新闻周刊
2026-08-18 19:46:04
曝招商蛇口高管赵某强奸未遂被抓,曾是高考状元,毕业于清华大学

曝招商蛇口高管赵某强奸未遂被抓,曾是高考状元,毕业于清华大学

180视角
2026-08-18 11:51:26
旧江湖的最后一醉

旧江湖的最后一醉

大嘴説
2026-08-18 16:37:03
最新:乌克兰摧毁黑海舰队重量级军舰“马卡罗夫海军上将”号

最新:乌克兰摧毁黑海舰队重量级军舰“马卡罗夫海军上将”号

项鹏飞
2026-08-18 20:54:16
精日分子跑去靖国神社“表忠心”,反被日本人当反日分子揍了

精日分子跑去靖国神社“表忠心”,反被日本人当反日分子揍了

不掉线电波
2026-08-18 14:09:23
“弟弟举报哥哥冒名上大学”案母亲首度露面,否认哥哥改名换姓:弟弟小时候很听话,长大当上公务员就飘了,嫌我们农村人穷

“弟弟举报哥哥冒名上大学”案母亲首度露面,否认哥哥改名换姓:弟弟小时候很听话,长大当上公务员就飘了,嫌我们农村人穷

上观新闻
2026-08-18 10:44:36
2026-08-19 09:47:01
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13788文章数 142720关注度
往期回顾 全部

科技要闻

突发!OpenAI主动踩刹车 最强模型暂停训练

头条要闻

阿姨将楼道变"私人储藏室" 封死消防喷淋劝阻14次无果

头条要闻

阿姨将楼道变"私人储藏室" 封死消防喷淋劝阻14次无果

体育要闻

中国男篮,一直被质疑,永远被期待

娱乐要闻

230万变3亿,章子怡活成自己的靠山

财经要闻

重要信号 部分存储芯片现货价格松动下行

汽车要闻

北京现代造了一台“京北小兰博”?艾尼氪 V静态体验

态度原创

教育
时尚
亲子
健康
艺术

教育要闻

澳大利亚叫停中澳高校合作办学项目,这已经不是今年的第一次了……

秋天流行穿粉色,减龄又好看!

亲子要闻

孩子不爱吃饭?可能是脾胃在“罢工”!

女孩更易侧弯?几类孩子风险偏高

艺术要闻

谷歌改造芝加哥地标,新貌长这样!

无障碍浏览 进入关怀版