Google 在 9 月 30 日发布了 Gemini 4 Argon。名字里没有 Pro,也没有 Ultra,直接用一个化学元素命名——氩。这个命名方式本身就透露出一点信号:它不是来补位通用对话的,而是冲着另一件事去的。 官方给出的核心参数是 **1M token 输出上限**。注意,是输出,不是输入。这意味着模型可以在一次运行里持续进行深度推理,而不是被切成一段段短回答。定位也很明确:长程复杂任务,主攻编程、企业知识工作和网络安全三个方向。 **三个方向,三组数字** 编程方向,DeepSWE v1.1 上达到 **77.9%**。企业知识工作方向,在 Vals Index 和 Harvey 基准上排名第一,Zapier 自动化场景拿到 **51.3%**。网络安全方向,CWE-bench 并列第一,成绩 **68%**,黑盒渗透测试超过 3.8 Flash Cyber。视频理解方面,LVBench 得分 **91.7%**。 这些基准覆盖的场景有个共同点:任务链条长,中间步骤多,对持续推理的稳定性要求高。短输出模型在这类任务上容易断片,而 1M token 的输出空间,恰好是给这种长链条留的余地。 **内部实战数据才是重点** 比基准更值得看的是 Google 自己放出的内部案例。量子团队用它在时空资源优化上超越了已发表结果 **40%**。Agent 团队释放了超过 **300 TiB** 内存。Fuchsia 内核完成了 **80 万行** C/C++ 到 Rust 的转换。 这三个案例分别对应研究、基础设施和系统迁移,都不是靠一次问答能完成的活。它们需要模型在长时间运行中保持上下文一致,并且能处理跨文件、跨模块的依赖关系。官方用这些案例想说明的,是“长输出+深推理”在真实软件工程里的位置——不是锦上添花,而是有些任务离开它就做不了。 作者在文末还幽默地提了一句氩元素的化学记忆,算是给这份技术发布添了点轻松感。但从整体信息看,Gemini 4 Argon 的路线很清楚:不跟通用对话模型抢地盘,而是把长程复杂任务当成自己的主场。对企业用户和开发者来说,这个方向的实用价值,可能比多轮闲聊的流畅度更值得关注。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.