网易首页 > 网易号 > 正文 申请入驻

谷歌最新 Gemini Agent 爆击GPT-5.2?人类最后考试得分见分晓!网友:Altman又该发“红色警报”了

0
分享至

作者|冬梅

在全球人工智能领域竞争快速升温的当下,谷歌与 OpenAI 再次在同一天抛出重磅更新,令整个行业的注意力高度集中。

昨天夜里,谷歌发布了全新“重新构想”的 Gemini Deep Research 版本,并首次开放了嵌入式研究智能体 API。

而几乎同时,OpenAI 正式发布了备受期待的 GPT-5.2(代号 Garlic)。两家公司围绕智能体(Agent)未来、基础大模型能力边界以及应用生态主导权的竞争,正进入一个前所未有的焦灼阶段。

这一次,谷歌和 OpenAI 的攻防几乎精确地踩在同一时间窗口,让外界得以清晰观察这两家全球 AI 巨头之间的战略对抗节奏。

1 谷歌推出全新 Deep Research Agent

谷歌推出的全新 Gemini Deep Research 工具是一款智能 Agent,能够整合海量信息并处理提示信息中大量的上下文数据。谷歌表示,客户使用 Deep Research Agent 执行的任务范围广泛,从尽职调查到药物毒性安全研究均有涉及。

谷歌还表示,很快会将这款全新的 Deep Research Agent 集成到其各项服务中,包括谷歌搜索、谷歌财经、Gemini 应用以及广受欢迎的 NotebookLM。这标志着谷歌正朝着一个未来世界迈出又一步:未来,人类将不再使用谷歌搜索任何内容,而是由人工智能代理代劳。

具体而言,Deep Research Agent 有哪些能力?

在此次更新中,Google 不仅对 Deep Research Agent 进行了架构级的再设计,还以 Gemini 3 Pro 为核心基础模型,构建了一个更加稳定、准确、可追溯的深度研究系统。新版 Deep Research Agent 的能力提升可总结为三个关键方向:模型升级、推理稳定性突破以及交互能力全面增强

先说模型升级。新版 Deep Research Agent 完全基于 Gemini 3 Pro 构建,而 Gemini 3 Pro 被谷歌视为其迄今最“真实”、最可靠、最适合长链推理的旗舰模型版本。谷歌强调,这不仅是性能提升,更是研究型智能体“可依赖性”的质变。

为了构建这样的智能体,谷歌采用了多步强化学习(Reinforcement Learning over Multi-step Trajectories)的训练策略。其目标非常明确:在长达数十步、数百步的复杂研究任务中,AI 必须保持推理路径稳定,减少出现幻觉的概率,并确保连续决策过程中的一致性。

传统 LLM 在长链推理中的主要痛点之一,就是每一步推理都会引入累计误差——只要一个幻觉性的节点,就可能导致整个输出结果失效。谷歌强调,新版 Deep Research 在这一点上取得重大突破:

  • 多轮强化学习优化决策序列

  • 在冗长任务链中显著减少逻辑偏移

  • 更稳定的检索—分析—推理—引用闭环

这使得 Deep Research 可以承担以往 LLM 无法胜任的任务,例如完整执行跨天级研究、政策评估、多源数据整合和全流程尽职调查。

新版 Deep Research Agent 的另一个核心优势是其超大规模上下文处理能力。在 Gemini 3 Pro 的支持下,它可以一次性处理远超以往的资料量,包括学术论文、官方报告、长篇网页内容等,更重要的是,谷歌为 Deep Research 加入了一项“研究级标准能力”:它会为每一条观点、每一个结论自动附上可追溯引用来源。引用不仅是网址链接,而是结构化地指向原文中的关键片段或段落,以确保输出可信、观点可查,用户可进行二次调查与审核 。这使 Deep Research 不是“生成内容”,而是“提供带证据链的研究结果”。

此次版本更新不仅是功能升级,而是谷歌围绕“研究型智能体生态”的一次系统性发布。除了 Deep Research Agent 更新,谷歌还推出两项关键新能力:开源全新网络研究智能体基准:DeepSearchQA 和全新交互 API。

在当前行业中,网络研究型智能体缺乏统一衡量标准。为了证明谷歌取得的进展,谷歌又创建了一个新的基准测试。这个新基准测试名为 DeepSearchQA,旨在测试智能体在复杂的多步骤信息检索任务中的表现。谷歌已将该基准测试开源。


DeepSearchQA 开源地址:
https://www.kaggle.com/benchmarks/google/dsqa/leaderboard

DeepSearchQA 包含 17 个领域共 900 道精心设计的“因果链”任务,每一步都依赖于先前的分析。与传统的基于事实的测试不同,DeepSearchQA 衡量的是全面性,要求智能体生成详尽的答案集。这既评估了研究的精确度,也评估了检索召回率。


对比 pass@8 和 pass@1 的结果,可以证明让智能体探索多条并行路径进行答案验证的价值。这些结果是在 DeepSearchQA 的 200 个提示子集上计算得出的。

全新的 Deep Research Agent 在“人类最后的考试”(HLE)和 DeepSearchQA 测试中取得了最先进的成果,并在 BrowseComp 测试中表现最佳。它经过优化,能够以更低的成本生成高质量的研究报告。

基准测试结果令人惊叹。它基于 Gemini 3 Pro 核心构建,但采用智能体工作流程来实现最先进的性能。统计数据(来自图表):

  • 人类的最后考试(HLE): 46.4%(显著优于 GPT-5 Pro 的 38.9%)

  • DeepSearchQA: 66.1%(略胜 GPT-5 Pro 的 65.2%)

  • BrowseComp: 59.2%(与 GPT-5 Pro 不分伯仲)

Gemini Deep Research 在完整的“人类最后的考试”(HLE)数据集上取得了 46.4% 的领先成绩,在 DeepSearchQA 上取得了 66.1% 的成绩,在 BrowseComp 上取得了高达 59.2% 的成绩。

Interactions API 是谷歌此次发布的最具战略意义的能力之一。它让开发者首次能够以结构化方式控制智能体的行为状态、推理步骤、长链任务执行、中间状态存储等,这意味着以前开发者只能“向模型发问”,而现在开发者可以“调教智能体如何执行任务”。

2 网友怎么看?

在谷歌发布新版 Deep Research Agent 后,技术社区的反应同样值得关注。

在 Hacker News 与 Reddit 相关讨论帖中,不少开发者表达了对谷歌此次“真正把 Agent 做成工程化产品”的肯定。

在 Reddit 上,有用户对技术的进步发出感叹:

“太不可思议了!我觉得我们还没有充分意识到这一点。过去三年我们取得的进步简直令人难以置信!”

有网友指出,谷歌首次在产品层面强调“可验证引用”“端到端多步推理稳定性”,是 AI Agent 领域一次明显的进步。

一位自称长期从事合规审阅工作的用户评论说:“如果 Deep Research 真的能做到逐步链路可审计,那将是第一次有大厂真正把 Agent 从玩具推向生产环境。”

但也有观点保持谨慎,一位 Reddit 用户批评道:“谷歌用自家基准证明自己最强,这种事情已经发生过太多次了。我们需要的是在真实网页、真实任务中的第三方测试。”

谷歌这款新 Agent 的发布时间与 OpenAI GPT-5.2 是同一天,自然难逃网友们将两者相比较的命运。

在 Reddit 上,有用户提问这款 Deep Research Agent 与同一时间 OpenAI 发布的 GPT-5.2 相比如何,另一位用户回答称用途不同,但 GPT-5.2 更好。

为了将两者进行更清晰的对比,还有网友找出了 OpenAI 研究员 Sebastien Bubeck

在领英上的发文,在这篇发文中,Sebastien Bubeck 称 GPT-5.2 在人类的最后考试(HLE)中的得分是 45%,而谷歌这款新的 Agent 的得分是 46.4%,略高于 GPT-5.2。

同时,围绕谷歌与 OpenAI 的竞争,也有人发出调侃式评论:“谷歌刚发 Deep Research,OpenAI 就把 Garlic(GPT-5.2)端上来了,这俩公司现在简直是在互相抢发新闻。”

还有人总结这场激烈竞赛的节奏:“这已经不是模型大战,而是发布会大战。”

3 模型能力的“贴身肉搏”越演愈烈

基础模型能力始终是两家公司最具标志性的竞争焦点。

2025 年初,谷歌推出的 Gemini 3 Pro 以其更“真实”、更可依赖、幻觉率更低的特性,试图在长链推理和专业任务场景中重建优势。Gemini 3 Pro 强调检索增强、多模态处理能力以及大规模上下文处理能力,在科研、法律、金融等高可信场景中表现亮眼。

而 OpenAI 在最新发布的 GPT-5.2(Garlic)中,强化了逻辑一致性、工具调用稳定性以及智能体行为的自主性,进一步提升了跨任务泛化能力。内部基准测试显示,GPT-5.2 在推理、代码生成、多轮工具调度方面对 Gemini 保持领先,尤其是在 OpenAI 自研的“连续推理一致性 Benchmark”中表现突出。

两者之间的能力差距被行业评论认为“已进入毫厘级别”——差距常常只体现在特定任务场景,而不再是全局性的优势。

如果说基础模型决定了智能体能否思考,那么智能体平台能力则决定了智能体能否执行任务。

谷歌此次对 Gemini Deep Research Agent 进行全面重构,可视为其正式加入智能体战争的关键节点。

新版 Deep Research Agent 具有三大亮点:

  • 基于 Gemini 3 Pro 全面重写推理链路

  • 采用多步强化学习训练,保持长链任务中决策一致性,显著降低幻觉概率

  • 提供全链路引用,可追溯每个观点的证据来源

这使其从“报告生成工具”升级为“可执行完整研究任务的专业智能体”。更关键的是,谷歌推出了结构化控制智能体行为的 Interactions API,开发者可以对智能体的每一阶段、每一子任务进行高度可控的调度与状态管理。这意味着 Deep Research Agent 不再是谷歌产品线内部的能力,而是一个通用的智能体执行引擎。

OpenAI 的智能体体系则更侧重通用性和自由度。

Agent API、OpenAI Swarm、BrowserAgent、CodeAgent 已形成一个完整的智能体开发框架,加上 GPT-5.2 的推理一致性提升,让其在自动化任务执行、工具调用复杂度和环境适应性上保持优势。

两者竞争的是:未来软件开发将以智能体为核心,而谁掌握了智能体框架标准,谁就掌握了新一代计算范式的主导权。

https://ai.google.dev/gemini-api/docs/deep-research?hl=zh-cn

https://techcrunch.com/2025/12/11/google-launched-its-deepest-ai-research-agent-yet-on-the-same-day-openai-dropped-gpt-5-2/

声明:本文为 InfoQ 翻译整理,不代表平台观点,未经许可禁止转载。

InfoQ 老友!请留步!极客邦 1 号客服上线工作啦!

后续我将通过微信视频号,以视频的形式持续更新技术话题、未来发展趋势、创业经验、商业踩坑教训等精彩内容,和大家一同成长,开启知识交流之旅

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
日元汇率再次跌近160,日本经济还有救吗?

日元汇率再次跌近160,日本经济还有救吗?

观察者网
2026-08-12 19:11:07
千万人含泪下岗,没人愿意回忆的90年代,藏着中国最悲壮的逆袭

千万人含泪下岗,没人愿意回忆的90年代,藏着中国最悲壮的逆袭

浪子说
2026-08-12 08:20:59
程晓玥谈离婚上热搜,再看郑恺现状,才懂9年前分手是最好的安排

程晓玥谈离婚上热搜,再看郑恺现状,才懂9年前分手是最好的安排

夸大其词的说
2026-08-11 08:04:22
人狂过了头?郭德纲被举报篡改红歌,官方发声,这回真摊上事儿了

人狂过了头?郭德纲被举报篡改红歌,官方发声,这回真摊上事儿了

嫹笔牂牂
2026-08-13 07:21:03
韩景枫李谣开始互相抱怨,一个心疼亏钱,一个不满夫妻生活少太多

韩景枫李谣开始互相抱怨,一个心疼亏钱,一个不满夫妻生活少太多

嫹笔牂牂
2026-08-13 07:17:48
当年亿万鲜血推翻的私有制,如果今天全盘回归,革命还有意义吗?

当年亿万鲜血推翻的私有制,如果今天全盘回归,革命还有意义吗?

网络易不易
2026-08-10 11:33:59
本是一场余音绕梁的盛宴,为何成了噤若寒蝉的霸权?

本是一场余音绕梁的盛宴,为何成了噤若寒蝉的霸权?

问道求真
2026-08-02 20:43:51
浙江省国资委原党委书记、主任董贵波

浙江省国资委原党委书记、主任董贵波

汲古知新
2026-05-29 17:11:32
从富裕到贫穷,南非只用了一个伟人曼德拉,这个伟人他做了什么?

从富裕到贫穷,南非只用了一个伟人曼德拉,这个伟人他做了什么?

猪小艳吖
2026-06-25 22:17:25
儿子高考估分才400出头,亲戚都劝我让他去学门手艺,查分那天,他把手机递给我,我看到分数后手都在抖

儿子高考估分才400出头,亲戚都劝我让他去学门手艺,查分那天,他把手机递给我,我看到分数后手都在抖

晓艾故事汇
2026-08-11 09:31:41
62岁陈瑾现状:定居云南养老,与巫刚不是夫妻,无儿无女一身轻

62岁陈瑾现状:定居云南养老,与巫刚不是夫妻,无儿无女一身轻

老娱记啊
2026-08-12 14:54:24
伊朗情报主管落网——最高领袖发问:谁把导弹坐标给以色列的?

伊朗情报主管落网——最高领袖发问:谁把导弹坐标给以色列的?

鹤羽说个事
2026-08-13 00:36:14
医生发现:每天早起后先排便的人,用不了半年,身体或迎来5改变

医生发现:每天早起后先排便的人,用不了半年,身体或迎来5改变

路医生健康科普
2026-08-08 17:20:03
国米已经3500万欧签下热刺边后卫;哈维担任荷兰国家队新任主帅

国米已经3500万欧签下热刺边后卫;哈维担任荷兰国家队新任主帅

福酱的小时光
2026-08-13 07:32:25
中国科学院院士、同济大学原副校长陈义汉卸任院长,徐美东接棒上海市东方医院(同济大学附属东方医院)院长

中国科学院院士、同济大学原副校长陈义汉卸任院长,徐美东接棒上海市东方医院(同济大学附属东方医院)院长

双一流高校
2026-08-13 01:35:43
为什么我劝白发奶奶:少剪短发、多扎发?看这3组对比图你就懂了

为什么我劝白发奶奶:少剪短发、多扎发?看这3组对比图你就懂了

白宸侃片
2026-08-11 12:55:56
医生提醒:吃下一片他达拉非后,不止管一件事,还会带来5个变化

医生提醒:吃下一片他达拉非后,不止管一件事,还会带来5个变化

小胡军事爱好
2026-08-12 08:57:20
20岁李嫣上港媒头条!内衣外露、穿衣大胆,175cm干瘪身材像王菲

20岁李嫣上港媒头条!内衣外露、穿衣大胆,175cm干瘪身材像王菲

陈意小可爱
2026-08-13 01:01:18
多蓝委力挺傅崐萁,卢秀燕回应来了,黄国昌发声!韩国瑜或应思考

多蓝委力挺傅崐萁,卢秀燕回应来了,黄国昌发声!韩国瑜或应思考

爱意随风起呀
2026-08-13 00:16:38
我是北京人去了武汉和郑州,说句实在话:武汉跟郑州真不是一回事

我是北京人去了武汉和郑州,说句实在话:武汉跟郑州真不是一回事

夜深爱杂谈
2026-08-11 20:06:59
2026-08-13 08:19:00
InfoQ incentive-icons
InfoQ
有内容的技术社区媒体
12796文章数 52031关注度
往期回顾 全部

科技要闻

DeepSeek V4 Pro正式版深夜"突袭"

头条要闻

男子遭"炸街"折磨刺死19岁小伙获死刑 被害人父亲发声

头条要闻

男子遭"炸街"折磨刺死19岁小伙获死刑 被害人父亲发声

体育要闻

杜兰特,所谓的“联盟小王”

娱乐要闻

老戏骨杨昆两夺金鹰奖,因物业费被告

财经要闻

华尔街把AI算力炒成下一个房地产?

汽车要闻

全系600km续航/空间表现出色 奇瑞风云T7预售10.99万起

态度原创

教育
时尚
亲子
游戏
健康

教育要闻

男孩中考701分,考入郑州外国语学校,错题本不用整得多美观,实用最重要

炎炎盛夏,正好Sportique一下!

亲子要闻

萌娃跳舞#宝宝带奶奶们又跳风生水起《《》》

《影之刃零》采用D加密和虚幻5 玩家担忧性能优化

身子歪≠脊柱侧弯,侧弯发病率没变

无障碍浏览 进入关怀版