谷歌又一次加快了Gemini模型的迭代速度。
美东时间9月2日周三,谷歌宣布推出Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两款新模型,分别瞄准长周期编程、智能体工作流与复杂推理,以及网络安全漏洞发现和自动修复。谷歌称,Gemini 3.8是其迄今“最强的推理和编程模型”,两款模型均通过长时间运行的智能体循环,不断评估和优化任务执行结果。
距离上一代Gemini 3.7 Flash发布仅过去三周,谷歌就再次推出新版本。谷歌表示,此次是其六周内第三次发布Flash模型;独立AI基准测试机构Artificial Analysis则指出,3.8 Flash已是谷歌不到四个月内推出的第四款Flash模型。
在性能提升的同时,谷歌继续维持低价策略:Gemini 3.8 Flash的引导价格与3.7 Flash相同,为每百万输入Token 0.75美元、每百万输出Token 3.75美元,优惠持续至今年年底。Artificial Analysis评测显示,3.8 Flash高推理档在其综合智能指数中获得59分,较3.7 Flash提高3分,并以每项任务约0.58美元的成本进入“智能程度—任务成本”性价比前沿。
从长周期编程到自主智能体,3.8 Flash更强调“把事做完”
Gemini 3.8 Flash此次的核心升级,是从单次代码生成进一步转向长周期的软件工程和自主智能体。
谷歌表示,3.8 Flash在DeepSWE v1.1长周期软件工程测试中,能够自主解决复杂工程问题并完成端到端任务,表现超过多数规模更大的前沿模型。与此同时,新模型在金融、法律等专业领域的智能体测试中也有所提升,在HLE-Verified测试中的得分达到54.9%。
这背后的关键变化,是谷歌让模型“做得更多”。
谷歌称,3.8 Flash在复杂任务上会执行更多推理步骤,并反复调用工具;模型还可以通过长时间运行的智能体循环,对自身结果进行评估和优化。也就是说,相比简单地给出一段代码或一个答案,3.8 Flash更强调规划、执行、检查和修正这一完整过程。
谷歌展示的案例也更加接近实际生产环境,包括通过Antigravity仅凭一个提示生成可运行的3D游戏、生成能够运行的DOS版Google Maps,以及在AI Studio中生成硬件拆解的交互式3D可视化工具。
这也意味着,Flash系列的定位正在发生变化:它不再只是一个追求速度和低成本的“小模型”,而是逐渐成为谷歌推动AI智能体落地的重要底层模型。
独立评测:智能指数升至59分,但“多做事”也意味着更高Token消耗
Artificial Analysis的独立测试进一步印证了3.8 Flash的能力提升。
该机构数据显示,Gemini 3.8 Flash高推理档的Artificial Analysis Intelligence Index得分为59分,比3.7 Flash的56分高3分;中推理档得分57分,低推理档则为52分。高推理档的输出速度约为305 Token/秒,位居其评测模型前列。
不过,性能提升并非完全没有代价。
Artificial Analysis指出,虽然谷歌维持了3.7 Flash的Token价格,但3.8 Flash高推理档每项任务的实际成本约为0.58美元,较3.7 Flash的0.40美元高约40%。原因在于,新模型平均每项任务的输出Token数量增加约30%,同时智能体评测中的交互轮数也有所增加。
换句话说,单价没有上涨,但模型为了完成更复杂的任务“思考得更多、调用得更多”,实际使用成本反而有所增加。
这也解释了谷歌为什么同时保留不同推理档位。Artificial Analysis数据显示,3.8 Flash中推理档每项任务成本约0.41美元,低推理档约0.24美元。对于追求成本效率的应用,开发者可以降低推理强度,或者继续使用3.7 Flash。
3.8 Flash Cyber瞄准网络安全:漏洞发现与自动打补丁
与通用版3.8 Flash同步发布的,是专门面向网络安全领域的Gemini 3.8 Flash Cyber。
谷歌称,新模型具备“前沿水平”的漏洞发现和自动修复能力,并重点强化了防御侧应用。其在CyberGym行业基准中的漏洞自主发现表现超过Gemini 3.5 Flash Cyber以及规模明显更大的前沿模型。
在谷歌内部覆盖20种编程语言的真实漏洞测试中,3.8 Flash Cyber的成功率超过70%;在CWE-Bench自动补丁测试中,pass@1达到47.2%,接近领先前沿模型的47.8%,但成本明显更低。
谷歌还公布了几个实际应用案例。
Chrome安全团队发现,3.8 Flash Cyber生成的正确漏洞补丁数量,是规模更大的商业模型的2.6倍;网络安全公司Wiz的内部渗透测试显示,该模型的召回率比其他前沿模型高7.5至9.7%,成本则低2.3至5.2倍。
谷歌云漏洞研究团队甚至利用该模型在不到两小时内发现了一项关键基础设施漏洞,而谷歌称这类漏洞过去通常需要数月才能完成研究和发现。
Fairwind计划启动,650多家机构获网络安全AI“优先通道”
伴随Gemini 3.8 Flash Cyber发布,谷歌还推出了Fairwind计划,将网络安全AI进一步推向政府、关键基础设施和大型企业。
根据谷歌公告,Fairwind是一个限制访问的项目,面向政府机构以及可信赖的云客户和网络安全合作伙伴开放。参与者可以使用Gemini 3.8 Flash Cyber,并结合谷歌的CodeMender工具,实现漏洞发现、验证和自动修复。
谷歌表示,参与机构需要将模型访问权限限制在内部网络安全、事件响应或渗透测试团队,并部署多因素身份验证等安全措施。目前Fairwind已经拥有超过650家全球合作伙伴,覆盖政府、关键基础设施以及核心技术平台。
这意味着谷歌此次并不只是发布一个网络安全模型,而是在尝试建立一个面向防御方的AI安全生态。
尤其值得注意的是,谷歌强调Fairwind将首先为政府和对社会韧性至关重要的企业提供访问权限,包括医疗、电信、能源和金融等关键基础设施运营商,以及维护广泛软件基础设施的技术平台。
Flash高频迭代,谷歌押注“更便宜的智能体”落地
从3.6 Flash到3.7 Flash,再到如今的3.8 Flash,谷歌正在明显加快Flash系列的更新节奏。
而与早期Flash模型强调“快”和“便宜”相比,如今的3.8 Flash更加突出长周期推理、工具调用、软件工程和自主智能体能力。谷歌试图证明的是:不一定需要最大规模的模型,才能完成越来越复杂的真实工作。
价格则成为谷歌扩大这一战略的重要杠杆。
3.8 Flash继续维持每百万输入Token 0.75美元、输出Token 3.75美元的年底前引导价格,同时提供1M Token上下文窗口,并支持文本、图像、语音和视频输入。消费者可以通过谷歌AI Pro和Ultra订阅使用,开发者则可以通过Antigravity、谷歌AI Studio和Android Studio调用,企业用户可通过Gemini Enterprise使用。
对于谷歌而言,这种策略的意义在于:在AI竞争从“谁的模型最强”逐渐转向“谁能让智能体以合理成本完成更多实际任务”的过程中,Flash系列可以凭借成本和速度优势抢占更大规模的应用入口。
而此次同时推出通用智能体模型和网络安全专用模型,也显示谷歌正在把Gemini的竞争重点从单纯的聊天和问答,进一步推向编程、企业工作流以及能够直接创造经济价值的AI执行任务。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.