Google在7月21日扔出的Gemini 3.6 Flash,第三方评测数据已经陆续出来了。先说最直观的两个数字:在Artificial Analysis的测试中,这个新模型的token输出速度冲到每秒303.6个,而同价位其他推理模型的成绩中位数是78.5。换句话说,价格差不多的对手,它的吞吐量高了将近三倍。
Artificial Analysis给Gemini 3.6 Flash打出的综合指数是50分,同一价位区间的模型中位数只有31分。这个成绩单怎么看?简单讲就是:它不是最聪明的那个,但在它这个价格带上,目前没有能跑赢它的选手。
![]()
速度优势到底有多大?HutchDB做了个对比测试,拿Gemini 3.6 Flash跟Claude Opus 4.8和GPT-5.6 Terra同场跑了一遍。结果很有意思:响应速度快了6倍,花掉的钱却只有Claude的19分之一。从收到请求到吐出第一个token的延迟数据也摆在那边,Gemini 3.6 Flash在这个指标上把一堆旗舰模型甩开了身位。
Google自己说,这个模型是基于Gemini 3.5 Flash上半年发布之后收到的开发者反馈迭代出来的。改动方向很明确:强化代码能力、知识工作、多模态处理,同时把输出token量砍掉了17%。减少token数意味着什么?做复杂的多步骤任务时,需要调用的推理步骤和工具请求也跟着变少了,长时间跑的Agent任务能更省资源。
具体看各项能力评测。在Artificial Analysis独立测量的几个维度上——现实世界Agent任务、金融领域任务、Agent代码与终端使用、纯代码能力——Gemini 3.6 Flash的位置很固定:排在Claude的顶配模型、GPT-5.6系列、GPT-5.5系列、中国的开源模型Kimi K3和Grok 4.5 high之后,但妥妥压住了后面一长串名字。代理式知识工作基准AA-Briefcase拿下961分,知识可信度与幻觉测试AA-Omniscience Index拿到24分,属于跟大部分头部模型不相上下的水平。
成本端的数据也很有意思。每个任务加权平均下来,Gemini 3.6 Flash的成本是0.5美元,大概81.5日元出头。放在最前沿的这帮模型里属于中间位置,不贵也不便宜。但把速度和成本放在一起看就清楚了:花差不多的钱,它吐结果的速度是同价位产品的4倍,这个性价比公式放到工程决策里是很直接的考量。
Google在7月21日这轮发布中不止推了Gemini 3.6 Flash一个。同时亮相的还有Gemini 3.5 Flash Lite——定位是大量处理任务时压低成本的轻量模型,以及Gemini 3.5 Flash Cyber——专攻漏洞发现和修复的网络安全模型。
三条线一起上阵,目的很明显:把不同场景的棋子摆满。而Gemini 3.6 Flash的角色,就是一个在速度和性价比上把同级别对手逼到墙角的通用选手。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.