谷歌 Gemini 4 先给防守方,再给所有人
谷歌发布 Gemini 4 Argon,第一批拿到它的人不是普通用户。
我盯的不是它的跑分,是它先给了谁。
就在发布前一天,它的 CEO 还在白宫签了一份自愿性质的安全协议,两件事只隔了一天。
周三,Alphabet 放出这代旗舰。
改进集中在三块:写代码、网络安全、还有金融法律这类复杂专业任务。
在真实软件工程基准上它刷新了纪录,网络安全基准并列第一;另一项覆盖金融法律等专业任务的测试,它同样排在最前。
发布顺序反过来了
按常规打法,旗舰模型先给大众尝鲜,再慢慢渗到企业。
我看这次是倒过来的。
先给筛选过的网络安全伙伴,同时跟美国政府一起做发布前安全评估。
Gemini 模型产品负责人 Doshi 对 CNBC 说,这样推让他们更有信心。
这也能更快把一个擅长防守的模型,交到防守方手里。
我更在意的是这句话的另一半。
我的读法是,交付对象被限定了,上线节奏就不再只由产品部门说了算。
真正在用它的人,不在你手里
发布之前,Argon 已经在内网干活。
其中一个活,是给谷歌数据中心的显存做优化,释放出数百 TB 内存,不用添置新硬件。
量子计算的研究人员也在用它。
这一条在我看来比任何跑分都实在:跑分证明它能做,内网的数字证明它值得做。
我顺着这条线看,模型的落地顺序被整个倒了过来。先落在关键负荷和关键岗位上,最后才轮到普通用户。
门槛在风险,不在能力
谷歌说,公开发布之前要先把四类网络安全风险收住,其中包括滥用和提示注入。
提示注入说白了,是有人把假指令藏在网页里。模型读到,就照着做了。
Doshi 把这代模型形容成全面型选手,擅长跑长时间、多步骤的任务。
相比本月初的 3.8 Flash Cyber,它在漏洞发现上有明显提升。
我留意到一个容易被忽略的细节。
我的判断是,能力越强,能被诱导去做的事也越多。
所以我把安全理解成能不能发布的前提,而不只是一道发布前的手续。
评价标准正在换轨
我把同期对比也摆出来。
网络安全基准上,它和 OpenAI 的 GPT-6 Astra、Grok 4.7 打平。
在 Vals Index 上它排得更前。
被压过的是 GPT-6 Astra 和最近的 Anthropic 模型。
它比 Gemini 3 晚了近一年。
中间谷歌还转过一次向,往更快、更便宜的 Flash 系列走。
把这几件事放在一起,我看到的是同一件事的两面。
表面上,谷歌这次发得慢了,还给自己套了几道锁。
我看它真正在抢的是定价权:从谁先放出来,转向谁能在放出来之前把风险收住。
我回望这一轮,一个最强模型的首次亮相,被安排在了防守方手里。
抽掉具体的名字,我看到一条很清楚的规律。
当模型开始接触关键基础设施,约束就会走在能力前面。
如果你的业务要用这类模型,我建议先想清楚它接的是哪一段流程。
下一步可以做的,是查一下你在用的模型有没有发布前评估的说明,别只看跑分。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.