网易首页 > 网易号 > 正文 申请入驻

领导层洗牌后,Argon能否助谷歌重回前沿?

0
分享至



谷歌的AI豪赌之路

图片来源|网络(如侵权请联系删除)部分AI生成

2026年的AI赛道,用“瞬息万变”来形容已经远远不够。如果你每隔两周没有关注前沿模型的动态,打开排行榜时大概率会怀疑自己是不是错过了整整一个季度。

就在这样近乎疯狂的产品迭代节奏中,谷歌DeepMind于9月30日正式发布了Gemini 4系列的首款旗舰模型Argon。距离上一代旗舰Gemini 3系列亮相,已经过去了将近十个月。

对于一个头部AI实验室来说,十个月的沉默几乎等同于一次豪赌。

但在讨论Argon之前,有一个更值得回看的背景,然而这场豪赌的筹码,其实在两个月前就已经被重新洗过一遍了。


一场“静悄悄的权力交接”

2026年8月5日,Alphabet CEO桑达尔·皮查伊通过内部信宣布了一项令业界震动的架构调整:Google DeepMind联合创始人兼CEO德米斯·哈萨比斯卸下日常运营管理职责,转任DeepMind董事长及Alphabet首席科学家。

首席技术官科雷·卡武克丘奥卢升任DeepMind高级副总裁,直接向皮查伊汇报。

而在这家公司工作了27年的首席科学家杰夫·迪恩,选择离开谷歌,与老搭档桑杰·格玛沃特共同创办一家独立的公益企业。

这组信息放在一起看,远不止几个人换个头衔那么简单。哈萨比斯是DeepMind的灵魂人物,从AlphaGo到AlphaFold,他的个人品牌几乎等同于DeepMind的公众形象。

把他从日常管理中“解放”出来,转而专注AGI长期战略和前沿科学,释放的信号非常明确:谷歌希望DeepMind从一家“顶级研究机构”变成一台“高效产品引擎”。

卡武克丘奥卢是深度学习的实干派,在DeepMind工作13年,从组建深度学习团队到主导WaveNet和DQN等突破,其履历横跨研究与工程两端。

让他掌舵日常运营,本质上是把“交付能力”提到了比“探索自由度”更高的优先级上。

更值得注意的是这次调整的空间维度。多家媒体分析指出,权力正在从伦敦向加州转移,谷歌联合创始人谢尔盖·布林的影响力也在回归。

这意味着DeepMind正在被更深地整合进谷歌的全球产品体系,而不是作为一座“研究飞地”独立运转。

对于一个需要在搜索、地图、Gmail、Chrome等十亿级用户产品中落地AI能力的公司来说,这种整合是必然的,但代价是DeepMind失去了相当程度的自主权。


Argon的牌面

理解了这次架构调整的底层逻辑,再来看Argon的表现,就能读出更多东西。

从纸面数据看,谷歌官方在19项基准测试中宣称Argon取得了13项领先,涵盖长周期软件工程、企业知识工作、网络安全漏洞修复等多个维度。

在衡量真实世界长期软件工程能力的DeepSWE v1.1测试中,Argon拿到了77.9%,超过了Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%。

在Zapier的AutomationBench——这个衡量企业端到端业务流程自动化执行能力的基准上,Argon以51.3%排名第一,比Claude Opus 5.5高出近9个百分点。

但Argon真正让人侧目的,不是某个单独的跑分数字,而是它把输出Token上限从上一代的6.4万直接拉到了100万。

输出上限和上下文窗口是两个完全不同的概念,前者决定的是模型在一次推理轨迹中能生成多长的内容。

100万Token的输出意味着模型可以在单次任务中持续推理、生成接近百万Token的结果,而不是被迫把复杂任务拆成好几轮来做。

这对大型代码库迁移、深度研究、多步骤企业流程这类场景的意义是结构性的。

实际落地的案例也在印证这一点。谷歌披露,Argon已经参与了内部C/C++代码库向Rust的迁移工作,覆盖超过80万行代码的Fuchsia Zircon内核。

在开源视频解码器libgav1项目中,Argon通过多轮性能测试和编译器分析,重写了约3.2万行SIMD代码,新的Rust版本运行速度达到原版本的2.7倍。

这些不是demo级别的展示,而是进入了谷歌核心基础设施的真实工程任务。

定价方面,Argon的推广期价格是每百万输入Token 2美元、每百万输出Token 10美元,缓存输入的价格更是比标准输入低了95%。

根据Artificial Analysis的测算,在折扣价下,Argon完成单个任务的成本约为1.99美元,比GPT-6 Astra低了约40%。

这个价格策略的进攻性非常明显,谷歌是在告诉企业客户:你不一定需要最强的模型,但你一定需要性价比最高的那个。



跑分之外,裂缝同样清晰

Argon的问题和它的亮点一样突出,而且这些问题恰恰暴露了谷歌在AI战略上的深层矛盾。

首先,Argon并非在所有维度上都领先。在FrontierSWE v2和Terminal-Bench Science 0.1这两个终端和科学推理相关的测试中,GPT-6 Astra领先Argon超过10个百分点;在Terminal-bench 4.0上,Claude Opus 5.5以66.4%大幅领先Argon的57.4%。

The Decoder的评论更是一针见血:Argon“缩小了与OpenAI和Anthropic的差距,但并未取得明显领先”。

另外,彭博社在Argon发布当天报道称,部分谷歌员工对该模型在实际编程工作中的表现存在质疑。

据知情人士透露,尽管Argon在标准基准测试上成绩不错,但当员工真正将其用于日常编码任务时,表现并不尽如人意,尤其是在前端设计等领域存在明显短板。

这种“跑分亮眼、实战存疑”的落差,引发了外界对谷歌是否存在“benchmaxxing”(为跑分而优化)的质疑。

这里面有一个容易被忽略的技术细节。Argon在DeepSWE v1.1上拿到77.9%的高分,但在更接近真实工程复杂度的FrontierSWE v2上只有55.0%,被GPT-6 Astra的65.5%拉开了超过10个百分点。

两个测试的核心差异在于任务链条的长度和环境的不确定性,即前者在相对结构化的条件下评估代码生成能力,后者更接近开发者在实际项目中面对的混乱状态。

这个差距指向一个可能性:Argon在受控环境中的表现出色,但面对真实世界中模糊的需求、不完整的代码上下文和跨模块依赖时,能力衰减比竞品更明显。

这恰好解释了为什么谷歌选择分阶段发布。Argon目前仅通过Fairwind计划向受信任的网络安全防御者开放,普通开发者和消费者还需要等待。

谷歌的官方说法是需要进一步加固安全防护,但这个理由背后可能还有一层考量:先在小范围内收集真实场景反馈,用实际使用数据来校准模型在非受控环境中的表现。

部分开发者对此表达了不满,有人在社交平台上直言:“跑分是领先了,但普通开发者连API都用不上,又要排队。”



掉队的谷歌,追赶的代价

要客观评估Argon能否帮谷歌“重回前沿”,需要先理解谷歌是怎么“掉队”的。

2025年11月,Gemini 3发布后收获了不错的评价,一度被认为是谷歌追赶OpenAI和Anthropic的转折点。

2026年5月的I/O开发者大会上,谷歌公布了迭代版本Gemini 3.5 Pro,并承诺6月正式发布,然而这个承诺从未兑现。

据多家媒体报道,Gemini 3.5 Pro的训练周期超出预期但结果不理想,项目最终被搁置。有分析师估算,这一级别的大模型单次训练运行的开销最高可达4亿美元。

一次失败的训练不仅意味着金钱和时间的损失,更意味着在竞争对手加速迭代的窗口期内,谷歌被迫按下了暂停键。

与此同时,2026年的竞争格局呈现出前所未有的胶着态势。年初Anthropic凭借极致的智能体产品架构和编程能力实现反超;第二季度OpenAI通过限量发布GPT-5.5、GPT-5.6系列重新夺回制高点。

7月Anthropic又推出Claude Sonnet 5,号称“最具代理能力”的中端模型。

到9月下旬,Anthropic发布Claude Opus 5.5,常规负载成本比上一代下降40%,输出速度提升超过30%。各大巨头交替领先,没有任何一方能保持超过一个季度的优势。

在这个背景下审视Argon,它更像是谷歌在经历了一次代价高昂的“跳票”之后,用一次架构重组和一款新模型发起的双重反击。

但反击的效果,取决于一个比跑分更根本的问题:谷歌是否找到了适合自己的竞争策略?

不过谷歌有一个其他竞争对手不具备的优势,那就是它拥有超过十亿用户的产品矩阵。Gemini模型支撑着搜索页面的AI回答、谷歌地图、Gmail和Chrome,Gemini应用月活用户已突破9.5亿。

这种分发能力意味着,即使模型本身不是绝对最强,谷歌也能让AI能力触达比任何竞争对手都多的用户。

但问题在于,分发优势只有在模型“够好”的时候才能转化为竞争力。如果用户在使用谷歌搜索的AI回答时觉得不如ChatGPT准确,在使用Gemini应用时觉得不如Claude顺手,那么庞大的用户基数反而会加速负面口碑的传播。

OpenAI和Anthropic已经不再仅仅出售模型,而是越来越多地打造自有产品和编程智能体。

如果谷歌拿不出一款顶尖的新一代模型,竞争对手就会获得更多机会去说服消费者和开发者,让他们相信未来的搜索和软件应该搭建在竞争对手的平台上。

Argon的策略选择很有意思:它没有追求“全能冠军”,而是把资源集中在企业知识工作、软件工程和网络安全这三个高价值场景上。

这或许反映了一个务实的判断,也就是在通用能力上全面碾压对手的窗口期可能已经过去了,与其追求面面俱到,不如在几个关键战场上打出差异化。

Argon在网络安全方面的表现尤其值得关注。在CWE-bench v1漏洞修复评测中,Argon以68%的成绩并列第一。

更具体地说,谷歌称Argon曾发现一项影响全球医院所用医疗软件的严重漏洞,而此前的前沿模型未能识别出这一风险。

在网络安全这个领域,“发现别人发现不了的漏洞”比“跑分高几个百分点”有说服力得多。

定价策略同样体现了务实的转向。过去几个月,谷歌的对外沟通重心已经从“展示Gemini的尖端能力”转向“强调与竞品相比的成本优势”。

这是一个信号:在模型能力差距缩小到几个百分点的当下,谷歌选择用性价比来争夺开发者生态和企业客户。


回到牌桌上的前提

Argon的发布,至少证明了三件事:谷歌仍然具备训练前沿级别模型的能力;新的管理架构能够在相对短的时间内交付产品;谷歌在网络安全等垂直场景中找到了差异化的切入角度。

但Argon也暴露了谷歌尚未解决的问题。内部对模型实战能力的争议、在部分关键基准上的落后、以及“先给少数人用”的分阶段策略,都说明Argon不是一个“一锤定音”的产品。

它更像是一张入场券,看似让谷歌重新回到了前沿模型竞争的第一梯队,但距离“重回前沿”还有相当的距离。

AI行业的迭代速度已经快到令人窒息的程度。从ChatGPT上线至今,OpenAI和Anthropic已经累计发布了超过40个重磅模型,平均每6天就有一个新旗舰诞生。

在这个节奏下,任何一款模型的技术领先窗口都极其短暂。Argon今天在DeepSWE上的77.9%可能下周就会被刷新,Vals Index上的领先可能下个月就会被反超。

谷歌真正的考验不在发布日,而在发布之后。

Argon能否在真实开发者的工作流中证明自己,能否在安全护栏加固后顺利开放给更广泛的用户群体,能否在下一轮竞争中以更快的节奏交付迭代……

这些问题的答案,不取决于谷歌的官方博客怎么写,也不取决于基准测试的数字有多好看,而是取决于市场会给出最终的判断。

不过市场的耐心,从来都是有限度的。

01

02

03

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
真是开眼了!上海一栋老洋房标价3.8亿,引发热议,网友调侃:从唐朝开始干,每年攒30来万,就可以轻松拿下

真是开眼了!上海一栋老洋房标价3.8亿,引发热议,网友调侃:从唐朝开始干,每年攒30来万,就可以轻松拿下

火山詩话
2026-10-01 05:13:46
又一架图-95坠毁,俄已折损大半

又一架图-95坠毁,俄已折损大半

书生论剑
2026-09-30 07:33:21
Shams:杰伦-杜伦接受活塞5年2亿美元全额保障合同

Shams:杰伦-杜伦接受活塞5年2亿美元全额保障合同

懂球帝
2026-10-02 11:49:07
金价一夜变天!有人哭晕,有人却笑了,现在该抄底还是快跑?

金价一夜变天!有人哭晕,有人却笑了,现在该抄底还是快跑?

叮当当科技
2026-10-02 07:31:13
10月1日,财政部发布重要消息,2026年养老金调整确定了吗?

10月1日,财政部发布重要消息,2026年养老金调整确定了吗?

虎哥闲聊
2026-10-01 14:23:06
法媒:波尔多跌入法第六级;阵容身价暴跌99.98%

法媒:波尔多跌入法第六级;阵容身价暴跌99.98%

懂球帝
2026-10-02 03:24:07
人民日报连续三天发表重磅文章!突然密集发声,背后信息非同小可

人民日报连续三天发表重磅文章!突然密集发声,背后信息非同小可

顾史
2026-09-30 09:48:55
拉夫罗夫主动让出位子,功成身退时机刚好,普京早已安排别人顶上

拉夫罗夫主动让出位子,功成身退时机刚好,普京早已安排别人顶上

深析古今
2026-10-01 05:24:44
沉默一周后,一架美军运输机突降深圳,来要回F-35战机的零部件?

沉默一周后,一架美军运输机突降深圳,来要回F-35战机的零部件?

云上乌托邦
2026-10-01 22:42:43
邝兆镭造险,83分钟遭绝杀,U17国少0-1不敌非洲劲旅

邝兆镭造险,83分钟遭绝杀,U17国少0-1不敌非洲劲旅

侧身凌空斩
2026-10-02 02:33:44
10月2日,全民关注的养老金调整通知出炉了吗?涨2.2%真难吗?

10月2日,全民关注的养老金调整通知出炉了吗?涨2.2%真难吗?

兵卒史
2026-10-02 13:29:17
最高法:回村定居的退休人员,有权重修祖宅或申请宅基地建房

最高法:回村定居的退休人员,有权重修祖宅或申请宅基地建房

智慧生活笔记
2026-10-01 09:54:07
不查不知道,一查吓一跳,坐拥上亿的刘亦菲,生活阔得超乎想象

不查不知道,一查吓一跳,坐拥上亿的刘亦菲,生活阔得超乎想象

史行途
2026-09-15 18:21:20
4年血亏9亿!“打败皮鞋的,并不是另一双皮鞋”,皮鞋被时代抛弃

4年血亏9亿!“打败皮鞋的,并不是另一双皮鞋”,皮鞋被时代抛弃

李砍柴
2026-10-01 17:00:17
费迪南德:C罗出现前,葡萄牙队是什么水平?请尊重C罗

费迪南德:C罗出现前,葡萄牙队是什么水平?请尊重C罗

懂球帝
2026-10-02 03:34:08
从确诊到去世仅15天,“央视最帅主持人”的遭遇为人们敲响警钟

从确诊到去世仅15天,“央视最帅主持人”的遭遇为人们敲响警钟

银河史记
2025-11-03 19:31:33
为什么有人非把英语当阶级身份象征?

为什么有人非把英语当阶级身份象征?

小眼睛小世界
2026-10-02 04:34:02
十年换了无数天价珠宝,没一次赢过刘亦菲的脸,宝格丽彻底服了

十年换了无数天价珠宝,没一次赢过刘亦菲的脸,宝格丽彻底服了

流云随风去远方
2026-07-31 19:44:34
若是不出意外!2027年起,保安,保洁,将迎来行业新一轮洗牌!

若是不出意外!2027年起,保安,保洁,将迎来行业新一轮洗牌!

童童聊娱乐啊
2026-09-30 10:20:39
祸不单行!男子自述得了肺癌晚期,却发现孩子不是亲生的,老婆还转移了他白手起家挣下的2700万

祸不单行!男子自述得了肺癌晚期,却发现孩子不是亲生的,老婆还转移了他白手起家挣下的2700万

王老师你还好吗
2026-09-24 04:50:47
2026-10-02 15:24:49
影子聊科技 incentive-icons
影子聊科技
带你了解前沿科技资讯
108文章数 7关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

女子退休前查出癌症花光积蓄去南极旅游 回来肿瘤小了

头条要闻

女子退休前查出癌症花光积蓄去南极旅游 回来肿瘤小了

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

珠宝黑马爆雷,老板全家跑路泰国!

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

数码
手机
家居
房产
游戏

数码要闻

金刚狼限量版PS5 Slim拆解:索尼升级主板、优化散热

手机要闻

存储危机还在恶化!入门手机几近灭绝 笔记本销量已暴跌25%!

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

4000+/平!华侨城,直接把海口楼市的地板给掀了!

《战争机器》新作发福利了!UU加速器时长免费领

无障碍浏览 进入关怀版