谷歌这回直接扔了个王炸出来,CEO皮查伊亲自站台官宣新模型Gemini 4 Argon。它根本不是做来给普通人聊天摸鱼的玩具,上来就瞄准了真刀真枪干活的场景——长流程软件工程、企业知识工作还有网络安全防御。刚一发布就甩出一堆亮眼成绩,还直接拿自家操作系统的80多万行内核练手,整个AI圈直接炸了。
![]()
很多人看新闻第一反应都是,不就是上下文窗口变大吗?这次不一样,谷歌提的是输出Token上限,原来的64K直接翻了十几倍,干到100万了。更大的输出空间,能让模型在一次任务里做更深的推理,hold住更长更复杂的活。
软件迁移、金融研究这类活,不是说你问一句我答一句就能完事的。得一步步分析,做错了还要验证修改,得一直沿着目标推进,不能半路跑偏。光输出上限高没用,能不能稳住目标、正确调用工具、自己发现改正错误,才是真本事。
![]()
DeepSWE v1.1评测里,Argon拿下77.9%的成绩,直接刷新了这个评测的新纪录。这个基准测的就是真实的长流程软件工程能力,不是那种掺水的野榜。覆盖金融、编码、法律和税务的Vals Index中,Argon也处于领先位置。Zapier的AutomationBench测试里,它以51.3%的成绩排在第一。
长理解测试LVBench中,Argon拿到了91.7%的好成绩,同样是行业领先水平。比公开跑分更有看点的,是谷歌披露的内部工程落地案例,这才是真刀真枪试出来的本事。不少业内人都觉得,能不能落地干大活,比啥评测榜单都管用。
现在Argon的智能体已经参与了C/C++代码库向Rust的迁移项目,规模从最早核心库的数万行,扩展到了Fuchsia操作系统Zircon内核的80多万行代码。开源解码软件libgav1的项目里,Argon替换了约3.2万行SIMD代码,优化后运行速度达到原Rust移植版本的2.7倍。这个效率放在以前,一堆工程师加班两三个月都不一定能达到。
![]()
还有一组Argon智能体通过分析服务器集群的性能数据,自主完成了数据中心的内存优化。目前已经释放了超过300 TiB内存,预计总共能节省500 TiB 到1 PiB。就算不懂服务器运维的人也明白,这省下来的都是实打实的硬件成本。
量子算法研究领域也用上了它,模型短短几分钟就得出了结果,效果比已经发表的成熟方案还要好40%。这次Argon最先开放的领域是网络安全防御。谷歌给受信任的防御团队提供了不带安全防护限制的完整版本,就是为了让团队充分发挥模型的漏洞发现能力。
安全公司Wiz已经在相关计划中用上了Argon,早期演示里就发现了全球医院在用医疗软件中的敏感信息泄露漏洞。这个漏洞之前不少业内顶流大模型都没能识别出来。CWE-bench v1测试中,Argon以68%的成绩并列第一。
![]()
有亮眼成绩就绕不开争议,这回Argon没有直接向所有开发者开放。它先通过Fairwind计划开放给受信任团队,后续开放也要先从付费API客户和Google AI Ultra订阅用户开始,具体开放时间压根没公布。不少开发者直接吐槽,基准测试跑赢了所有人,普通开发者连API都摸不到,又要进等待名单排队。
这事其实戳中了当前大模型圈的一个现实问题。大模型能力竞争进入新阶段之后,公开评测的漂亮成绩,和普通用户实际能用的能力之间,距离正在变得越来越大。对开发者来说,能不能调用、接口好不好用、什么时候能用上,和跑分成绩一样重要。
![]()
价格方面,Argon上线初期定价是每百万输入Token 2美元,每百万输出Token 10美元,缓存输入价格低95%。实打实的能力大家都看得到,但是门槛也摆在这里,不管是访问门槛还是价格门槛都不低。普通的个人开发者,短时间内基本碰不到这个模型。
![]()
谷歌这波发布,更像是给整个行业指明接下来的发展方向,不是给普通开发者发能用的工具。接下来就看其他头部厂商怎么跟进,什么时候能把这种级别的能力,下放到普通开发者也能接触到的层面。AI卷能力的下半场,谁能先把顶尖能力落地开放,谁才能拿到更多主动权。
参考资料:新华网 谷歌发布新一代大模型Gemini 4 Argon
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.