网易首页 > 网易号 > 正文 申请入驻

重磅!智源发布 AREX 自主研究智能体:"求解 - 验证" 双循环,开启 AI 科研新范式 | 前沿在线

0
分享至



编辑:前沿在线 编辑部

当大模型逐渐掌握对话、推理、编程和工具调用之后,自主研究被视为人工智能领域的“The Next Big Thing”。

自主研究意义在于,AI的发展将不再受制于人类知识边界,形成一种面向智能生产的全新Scaling Law——投入多少能源,就将转化多少智力

自主研究正是衡量智能体自主研究能力重要维度之一。

普通问答只需要定位一个事实,而自主研究面对的是一组相互关联、彼此制约的条件。

智能体不仅要从庞大的信息空间中定位候选答案,还需整合分散甚至冲突的证据,并确认最终答案满足全部关键约束——只要有一项未验证,答案即为无效解。

自主研究的核心难题并不是“搜索得还不够久或者证据难找”,而是:智能体能不能知道当前答案到底已经成立了什么、还缺什么,以及下一步最应该研究什么,是如何让智能体在复杂约束中持续接近正确答案。

智源研究院发布的 AREX 正是围绕这一核心问题提出的

它抓住了自主研究中的关键突破口——“发现—验证不对称性”完整答案往往难以一次性生成,但一旦形成候选解,便可以通过针对关键约束的逐项验证,快速定位不足并指导后续探索。

验证的意义并非仅仅判断答案是否正确,更重要的是帮助智能体理解“已经知道什么、还缺少什么,以及下一步应该研究什么从而让每一轮研究都更加精准、更具方向性。

这一思想的前瞻性在Jeff Dean 近日创立的 Discovery Loop公司得到印证:未来的人工智能不仅需要更强的推理能力,更需要通过持续的实验、反馈和修正形成自主发现能力

AREX 对“求解—验证”双循环的探索,体现了智源研究团队在自主研究方向上的前瞻性,也反映出通过闭环迭代推动智能持续进化,正在成为人工智能发展的重要趋势。

项目主页:

https://vectorspacelab.github.io/arex-model/

模型权重:

https://huggingface.co/collections/BAAI/arex

体验链接:

https://arex-research.com


AREX旨在训练能长期运行、自我验证、持续修正的研究型智能体

AREX的目标,不是让模型在单轮回答中写出一个“看起来更完整”的答案,而是训练一种能长期运行、持续验证、递归修正的自主研究智能体——不是一次性给出答案,而是在“研究→验证→再研究”的循环中不断接近完整解,让模型真正具备持续改进当前解的能力。

面对复杂任务,智能体可以先给出一个阶段性答案;随后,它会逐项检查约束是否满足,保留已经验证的证据,定位尚未解决的主张,再发起更有针对性的后续研究。

当新的证据到来后,智能体会再次更新答案、重新验证,并判断是继续深入,还是结束研究并输出最终结论。

这一过程可以递归执行多轮:研究→ 暂定答案 → 逐项验证 → 定位缺口 → 定向研究 → 更新答案

这里的“自我改进”,并不是指模型在执行任务时在线更新参数,而是指智能体对自身研究状态和当前答案进行持续修正。

它不再只是一个“搜索后回答”的工具,而更像一个会反复检查研究进度、修正研究路径、沉淀有效证据的研究助手。

AREX通过双循环框架打通“找到答案”与“改进答案”的闭环。

AREX的整体方法,可以概括为一套双循环递归求解框架。内层循环负责“研究”,外层循环负责“改进”

二者协同,让智能体不只是向前搜索,而是在每一轮中继承已有进展、修正错误方向,并不断接近更可靠的答案。


内层循环Research Loop:内层循环负责完成一轮相对完整的研究

在这一阶段,智能体会围绕当前研究问题搜索信息、调用工具、收集证据、比较候选,并构造一个暂定答案。

它的目标不是一次性得到终局解,而是形成一个结构完整、证据可追踪、后续可以被审计的当前解

如果这是第一轮研究,智能体面对的是用户提出的原始问题。如果已经经过外层验证,那么它面对的就是一个被重新定义过、更聚焦的新问题。

例如:补齐某项缺失证据,消解两个来源之间的矛盾,或者替换一个无法满足全部条件的候选答案。

这意味着,每一轮研究都不是简单重复,而是在更清晰的问题上继续推进。

外层循环Self-Improvement Loop:外层循环负责判断当前答案究竟走到了哪一步。

AREX会依据任务中的各项约束,对暂定答案进行逐项审计,并形成约束级别的置信判断:哪些条件已经获得充分支持,哪些仍然不确定,哪些关键主张缺少证据,哪些结论需要重新研究。

如果所有必要条件都得到足够支持,智能体就结束研究并输出答案。如果仍有条件没有解决,验证结果就会被转化为下一轮内层循环的研究目标。

因此,外层循环不是简单地说“答案还不够好,再试一次”,而是明确告诉内层循环:已经解决了什么,接下来只需要解决什么。

这让每一轮递归都能继承已有成果,而不是从头开始。


机制分析:长程研究状态维护带来的性能提升

AREX的推理机制包含两个循环内层研究循环负责搜索、访问网页、验证证据、更新上下文并生成暂定答案;外层自我改进循环根据答案、证据和置信度,决定接受、继续细化或重新开始。

其中,自主上下文更新(ACU)是关键。

它不是普通摘要,而是面向下一步行动的研究状态:保留已验证发现、已排除候选、未解决约束和下一步计划。BrowseComp上的分析显示,AREX通常会主动更新上下文,而不是等到128K上下文窗口被塞满后才被动压缩。

受控实验显示,AREX完整系统在BrowseComp上达到82.5,比关闭ACU和外层循环的版本高出22.9个百分点。

训练消融也表明,渐进式多轮能力训练、关键步骤聚焦监督和步骤感知强化学习分别贡献于工具交互、关键决策和长程策略优化。



训练消融进一步说明,AREX的提升来自多个环节共同作用。

渐进式多轮能力训练先建立稳定的工具交互能力,关键步骤聚焦监督把训练信号集中到证据发现、路径否定与重定向、关键上下文更新等转折点,步骤感知强化学习则继续优化长程决策策略。

这也解释了AREX的核心思想:长程研究中真正难的不是例行搜索和访问网页,而是在关键时刻做对决定,什么时候相信一个证据,什么时候放弃一个候选,什么时候重整上下文并改变搜索方向,这些才是决定研究成败的步骤。


AREX让自主研究智能体在长程任务中持续自我进化

长程研究不“失忆”:将“历史包袱”转化为“进度路标”。

长程研究中的核心挑战,并不只是信息检索是否充分,更在于模型能否在持续延展的研究过程中稳定记住当前进展。

随着交互轨迹不断变长,历史记录中会同时包含已验证的证据、被推翻的假设、中途放弃的计划以及大量重复信息。

全盘保留这些内容容易让模型迷失方向,而简单截断又可能丢掉关键线索。

AREX的做法,是让模型在研究过程中主动调用上下文更新工具,将不断增长的交互历史整理成一个可以继续推进的研究状态

这种更新并不是普通摘要,而是一份“研究进度表”,帮助模型明确:当前研究到哪了?什么已经成立?什么已经被排除?接下来最该查什么?通过这种方式,模型能够持续继承有效信息、压缩冗余内容,并在当前阶段形成更稳健的最优解。

构造可验证的训练数据:从确定答案出发,生成可验证的研究轨迹。

自我改进不是靠延长搜索轨迹就能堆砌出来的。AREX 需要的是那种能真正教会模型如何发现线索、交叉验证、推翻错误候选、调整方向并继续前进的数据。

为此,AREX设计了一套可验证的自主研究任务生成方法:先从一个确定的实体答案出发,围绕它构造一组必须被真实证据支撑的约束条件,然后再把这些约束改写为无法通过关键词直接命中的开放式问题。

这样生成的任务,迫使模型必须真正去搜索、比对和验证,而不是在文本表述里“找答案”。

随后,强教师模型在同样工具环境中完整执行这些任务,留下全过程的研究轨迹。

但凡出现直接猜答案、忽略观察、证据不足或结论与证据矛盾等情况,整条轨迹都会被剔除。

最终保留下来的,是从不确定候选逐步走向可验证答案的研究轨迹。

分阶段训练与关键步骤强化:使模型掌握自我改进的连贯策略。

在获得高质量训练数据之后,训练顺序同样关键。AREX没有将所有轨迹简单混合训练,而是采取了分阶段策略。

模型首先学习多轮工具调用和证据获取的基本能力,再逐步进阶到长链推理、候选比较和困难问题求解。

同时,AREX还会巩固论文研究、高难知识推理等专项能力,避免不同任务之间的能力相互干扰。

AREX也不会把长轨迹中的每一步都同等对待。

真正决定研究是否能够取得突破的,往往是少数关键转折点,例如找到关键证据、否定错误候选、切换搜索方向,以及更新研究状态。

这些关键步骤会在训练中被重点关注,并在强化学习阶段继续优化模型的研究策略。

因此,AREX的自我改进能力并不是“多搜几轮”自然涌现的结果,而是由可验证任务设计、高质量轨迹筛选、分阶段训练和关键步骤强化共同塑造出来的。

它的目标是让智能体更接近真正的研究者:能够判断何时坚持当前方向,何时及时掉头,何时停下来确认答案。


实验评估:AREX以10B激活参数达到自主研究前沿水平

为了验证AREX是否具备真实自主研究能力,智源研究院在六个基准上进行了评测;

包括:BrowseComp、DeepSearchQA、WideSearch-en、GAIA、xbench-2510 和HLE with tools。它们分别覆盖信息深度、信息广度、深度与广度结合,以及端到端 Agent能力。


信息深度:在多跳信息中持续挖掘

BrowseComp和xbench-2510的任务设计颇为苛刻:问题往往嵌入了多个相互约束的条件,正确答案隐藏在分散的网页与间接证据之中,模型需要沿着线索逐级深入挖掘。

AREX-Base在BrowseComp上达到82.5,接近GPT-5.4、Kimi-K2.6、DeepSeek-V4-Pro和Claude Opus-4.6,同时超过GLM-5与Qwen3.5-397B。

在xbench-2510 上,它接近MiroThinker-H1,并优于Qwen3.5-397B与DeepSeek-V4-Flash。

结果表明,AREX能力提升并非来自更多轮次的搜索堆砌,而是源于更稳定的研究状态维护——模型能够保留已验证信息、排除错误候选,并持续围绕尚未解决的约束推进。

信息广度:在大规模信息空间中全面覆盖

WideSearch-en考察的是另一项能力:在大规模搜索空间中尽可能完整地找到目标条目,并完成去重、核验与汇总

AREX-Base在该基准上取得了82.0 Item-F1,为论文对比范围内的最高结果,超越了Kimi-K2.6、DeepSeek-V4-Pro、GPT-5.4等模型。

结果表明,AREX不只擅长“挖深一个答案”,也能管理大范围搜索任务,在长程检索中持续维护已覆盖范围和剩余空白。

深度与广度的结合:可迁移的研究方法论

DeepSearchQA同时要求多步检索、证据推理与答案完整性,是深度与广度的综合测试。

AREX-Base在这里取得了89.9 F1,超过GPT-5.4与DeepSeek-V4-Pro和 Qwen3.5-397B,并接近Claude Opus-4.6、Kimi-K2.6和Gemini-3.1-Pro。

这说明AREX学到的不是某个特定领域的搜索技巧,而是一套可迁移的研究方法论:检索、比较、验证、修正、聚合。

端到端能力:从搜索到完整研究流程

GAIA和HLE with tools进一步要求模型将搜索与规划、推理、工具调用结合起来。

AREX-Base在三项测试上分别取得85.4、71.0和52.4。

在GAIA上,它超过Kimi-K2.6、Gemini-3.1-Pro和Qwen3.5-397B;在HLE文本子集测评下,它超过GLM-5、DeepSeek-V4-Pro、Qwen3.5-397B和MiroThinker-H1。

这说明AREX的能力可以从搜索任务迁移到完整智能体工作流模型不仅能找到信息,还能规划行动、调用工具、验证中间结论,并组织最终答案。

总体性能对比:开源前沿、闭源旗舰与同量级模型

与开源前沿模型相比,AREX-Base在双方均报告的BrowseComp、GAIA、WideSearch-en和HLE文本子集上全部领先。

与DeepSeek-V4-Pro相比,AREX-Base在DeepSearchQA、WideSearch-en和HLE文本子集上更高。

与Kimi-K2.6相比,AREX-Base在GAIA和WideSearch-en上领先,在BrowseComp上接近,但在xbench-2510和DeepSearchQA上仍有差距。

测评结果显示AREX不是“所有单项都领先”,而是以10B激活参数,在深搜、广搜、端到端智能体和工具推理之间取得了均衡的综合竞争力。

与闭源旗舰模型相比,面对GPT-5.4、Claude Opus-4.6和Gemini-3.1-Pro等闭源旗舰,AREX-Base同样进入多个高难度基准的竞争区间。

它在BrowseComp上与GPT-5.4几乎持平,在DeepSearchQA上超过GPT-5.4,在WideSearch-en上超过GPT-5.4、Claude Opus-4.6和Gemini-3.1-Pro。

这表明AREX已经能够在关键自主研究任务上与闭源旗舰模型正面竞争,尤其在大范围信息覆盖任务中优势更明显。

与同量级基础模型与智能体模型相比,AREX-Base的总参数量为122B,每次推理仅激活10B参数。

相比同总参数量的Qwen3.5-122B,AREX-Base在双方均报告的指标上全部提升;相比更大规模的Qwen3.5-397B,AREX-Base在六项完整可比基准上全部领先。

与专门面向搜索和研究任务训练的智能体模型相比,AREX也体现出较高的参数效率。

AREX-Turbo只有4B参数,但在多项指标上超过Qwen3.5-35B、Quest-35B和 Tongyi-DeepResearch-30B;AREX-Base则在DeepSearchQA和HLE文本子集上超过 MiroThinker-H1,并在xbench-2510上与其接近。

这说明自主研究能力并不只来自扩大参数规模,也来自对长程研究过程的专门训练。


AREX研究平台:将自主研究能力封装为日常研究工具

AREX LLMs解决的是智能体如何开展长期、可靠的自主研究,而AREX Research Platform在此基础上,将这一能力封装为面向科研与产业用户的日常研究工具。

学术与产业界每天都会产生大量新增信息——论文、技术报告、会议talk、开源发布与行业分析。

而当前的信息分发机制多以发布时间或热度作为排序维度,而非依据用户的具体研究关注点进行组织。

高价值信息被碎片化地呈现,使用者往往需要在多个来源之间自行拼接背景,信息获取成本高、效率低。

AREX平台以模型驱动的内容获取与研究智能体为核心,针对三类不同的信息形态提供独立入口:资讯持续追踪指定领域内的每日动态,论文筛选高关注度的研究工作并支持深度理解,播客从长时段访谈中提取关键观点与行业趋势。

三者均由AREX智能体驱动,既支持广域浏览,也支持针对细分方向的定制化配置。


AREX首页(最终效果以上线版本为准)

定制化资讯服务:在信息组织方式上,AREX平台支持用户指定关注方向(如Coding Agent、芯片行业进展等),并据此生成持续运行的专属资讯智能体,按设定频率完成检索、筛选与汇总。

与传统“源订阅”相比,这一机制以“用户关注点”作为过滤维度,使信息流由“按热度排序”转向“按相关性组织”,从而降低无关信息干扰,提升信息获取的针对性。


AREX资讯定制

自由的可扩展性:此外,AREX平台在信息发现与自主研究之间提供直接衔接。

每条资讯、论文或播客旁均提供自主研究入口,可一键调用AREX 智能体。

智能体已感知当前阅读内容与上下文,无需重复交代背景,即可针对具体问题(例如“该方向是否有后续讨论”、“所选benchmark是否权威”、“相关观点在其他访谈中是否出现过”)启动检索、对比、分析与综合,输出完整的知识脉络。


聊一聊

平台承担内容发现,智能体承担理解与分析,二者在统一上下文下衔接。

这一设计是 AREX区别于单纯资讯工具的核心所在。

当前版本的AREX Research Platform覆盖科研工作流中的“信息获取”与“认知构建”两个阶段,即帮助用户发现相关信息并理解其研究背景。

智源研究院后续将能力延伸至研究执行阶段,由提供参考信息进一步发展为支持方案产出。

重点方向是端到端自主科研,包含以下三个环节:

方案设计——智能体在理解问题与现有方法后,自主提出创新方案、实验设计、对比策略;

工程实现——智能体直接生成可运行的代码框架、训练配置、评估脚本,并接入计算资源执行;

性能调优——智能体分析实验结果,识别瓶颈,自动迭代超参、调整结构,持续优化迭代。

最终实现:用户定义研究问题,由AREX自主完成探索、实验与优化,并交付可验证的研究结果。

AREX当前已开放BETA版测试,欢迎大家体验并反馈:arex-research.com


前沿动态前沿大会
前沿人物


「在看」,给前前加鸡腿

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
塔利班最新表态!心意已决,既然等不来中国松口,那就叫板联合国

塔利班最新表态!心意已决,既然等不来中国松口,那就叫板联合国

顾秋韵
2026-08-07 13:21:35
异性之间,发展亲密关系,离不开3个基本条件

异性之间,发展亲密关系,离不开3个基本条件

叶飞飞情感屋
2026-06-03 19:14:34
29岁Lori Harvey晒黑比基尼照身材火辣引热议

29岁Lori Harvey晒黑比基尼照身材火辣引热议

时光慢旅人
2026-08-09 00:51:54
“买英国精子生3娃”的山东女人,8年后现状曝光!如今她后悔不?

“买英国精子生3娃”的山东女人,8年后现状曝光!如今她后悔不?

米果说识
2026-08-08 09:38:32
特朗普也承认台湾问题将迎来终局,“台独”走到死胡同尽头

特朗普也承认台湾问题将迎来终局,“台独”走到死胡同尽头

小马姨
2026-08-09 11:05:38
黎笋长子:父亲下定决心对华开战前确认三件事,缺其一便不会打仗

黎笋长子:父亲下定决心对华开战前确认三件事,缺其一便不会打仗

唠叨说历史
2026-06-18 16:19:19
周渝民老婆曝周渝民不让女儿交男朋友:“以后谁要娶我女儿,没拿个几千万来我是不可能答应的!”

周渝民老婆曝周渝民不让女儿交男朋友:“以后谁要娶我女儿,没拿个几千万来我是不可能答应的!”

韩小娱
2026-08-08 06:35:18
这碗“毒面条”养废了多少孩子?很多家长未察觉,还在不停地喂

这碗“毒面条”养废了多少孩子?很多家长未察觉,还在不停地喂

浩源的妈妈
2026-08-05 16:30:27
闹大了!天津一业主群吵翻天:孩子深夜吵闹被邻居投诉,对方回应“谁家没有童年、一周才回家一次”

闹大了!天津一业主群吵翻天:孩子深夜吵闹被邻居投诉,对方回应“谁家没有童年、一周才回家一次”

火山詩话
2026-08-10 08:49:36
卡马文加离队倒计时?伯纳乌已没他的位置

卡马文加离队倒计时?伯纳乌已没他的位置

带你逛体坛
2026-08-10 16:07:12
不必紧张!白海豚北上降雨大幅缩水,山东难现400毫米特大暴雨

不必紧张!白海豚北上降雨大幅缩水,山东难现400毫米特大暴雨

海阔山遥YAO
2026-08-10 15:31:34
刚刚,OpenAI曝光GPT-6!传10万亿参数,8月强行发布

刚刚,OpenAI曝光GPT-6!传10万亿参数,8月强行发布

新智元
2026-08-10 07:48:32
中国移动10人被调查

中国移动10人被调查

地产微资讯
2026-08-09 14:41:06
王思聪携6名女伴现身巴黎卢浮宫!与两位女伴搂肩同行,关系亲密

王思聪携6名女伴现身巴黎卢浮宫!与两位女伴搂肩同行,关系亲密

风月得自难寻
2026-08-10 07:54:13
曝光!韩红一夜退出所有商业公司:从“走个面儿”到“破釜沉舟”

曝光!韩红一夜退出所有商业公司:从“走个面儿”到“破釜沉舟”

情感大头说说
2026-08-10 09:57:52
正式退出,陈幸同暂离队,前往四川,退役安置或曝光

正式退出,陈幸同暂离队,前往四川,退役安置或曝光

泥说体育
2026-07-13 22:09:44
运营商叫停网售电话卡:20元白菜价套餐换“马甲”,你的流量悄悄变贵

运营商叫停网售电话卡:20元白菜价套餐换“马甲”,你的流量悄悄变贵

新京报
2026-08-09 17:59:21
越南视角:越军少将评价解放军,我给美军打9分中国军队5分

越南视角:越军少将评价解放军,我给美军打9分中国军队5分

新一说史
2026-08-09 17:31:22
消息人士:若很快听到穆杰塔巴的死讯,伊朗官员“不会感到意外”

消息人士:若很快听到穆杰塔巴的死讯,伊朗官员“不会感到意外”

麓谷隐士
2026-08-10 08:10:03
偶像男团成员离奇死亡

偶像男团成员离奇死亡

中国新闻周刊
2026-08-10 15:13:52
2026-08-10 17:51:00
前沿在线 incentive-icons
前沿在线
前沿在线官方账号,关注AI、机器人、智能车等前沿领域;
355文章数 1236关注度
往期回顾 全部

科技要闻

马斯克又放大招:星链要吃掉全球一半流量

头条要闻

南太行失联女子在悬崖下200米被发现 事发区域未开发

头条要闻

南太行失联女子在悬崖下200米被发现 事发区域未开发

体育要闻

阿森纳的39号球衣,有了最适合的主人

娱乐要闻

演员秦焰去世 享年72岁

财经要闻

宇树科技今日申购,中一签能赚多少?

汽车要闻

实打实的体量感 家越07能否成为20万内家用SUV新爆款?

态度原创

旅游
游戏
时尚
亲子
公开课

旅游要闻

北京焦庄户地道战遗址纪念馆发布临时闭馆公告

玩家晒PS手柄收藏墙变吐槽大会:好一场漂移盛会!

今年夏天真的买了好多漂亮裙子(18图)

亲子要闻

放下电子设备,拥抱高质量亲子时光

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版