AI范儿 · 今日速评⏱ 6 分钟
昨晚我本来只想看一眼 Gemini 3.8 Flash 的更新,结果越看越精神。
Google 刚用一个价格很低的 Flash 模型冲到 DeepSWE 榜首附近,Meta 前后脚发布 Muse Spark 1.3,又在同一项测试里把成绩往上推了一截。
我把两张官方测试表放在一起看,这两个模型在多数关键项目上都超过了 GPT-5.6 Sol。3.8 Flash 的反差尤其大,它只是 Gemini 家族里的快速低价型号。
Gemini 3.8 Flash 多项能力超过 GPT-5.6 Sol;Muse Spark 1.3 的综合水平已经对标 Claude Fable 5。这就是两次发布最需要知道的结论
所以我觉得,这一晚有意思的地方并不只是榜首换了人。Google 把 Flash 推到了旗舰模型的桌上,Meta 则把 Muse 直接送到 Fable 5 旁边。
一分钟看懂
以当前榜单最前排的模型 GPT-5.6 Sol、Claude Fable 5 和 Opus 5 为参照物:
1Gemini 3.8 Flash:定位仍是快速、低价,但编程、金融分析、法律任务和复杂推理已经超过 GPT-5.6 Sol,部分能力贴近 Opus 5。
2Muse Spark 1.3:第三方综合榜已经来到 Fable 5 的水平,最明显的进步是能在长时间、跨工具的任务里把事情做完。
3普通人会感到的变化:模型不只回答问题,还能读长资料、改完整项目、操作软件,并在中途遇到问题时继续处理。
![]()
▲ 图:Gemini 3.8 Flash 与 3.8 Flash Cyber,来源 Google
01Flash 到底多强
Google 在六周内更新了三次 Flash。我最初以为这次还是常规升级,无非更快一点、更便宜一点。
看完表才发现,3.8 主要补的是长程编程、Agent 执行和专业领域推理。
Flash 原本承担的是快速、低价、大批量任务。现在 3.8 Flash 在多项测试里压过 GPT-5.6 Sol,部分项目甚至贴住或超过 Opus 5。
一个“经济适用型”模型打出了旗舰成绩,这才是这次发布最夸张的地方。
它支持文本、图片、音频、视频和 PDF 输入,拥有100 万 Token 上下文,一次可以塞进大型代码库、长文档或多段视频材料。
最大输出 64K,适合生成完整代码、报告和长篇分析,不用写到一半突然收摊。
![]()
▲ 图:Google 公布的 Gemini 3.8 Flash Benchmark 表
表很长,普通人没必要逐行背。我挑三个最能说明问题的地方。
DeepSWE会给模型一个真实代码仓库和待解决的问题,看它能不能跨多个文件完成修改并通过测试。3.8 比 3.7 提升 8.4 个百分点,已经紧贴 Claude Opus 5。
Terminal-Bench不让模型只写答案,而是要求它在终端里输入命令、检查结果、处理报错,直到任务完成。3.8 在这项测试里排到表中第一。
金融分析、法律工作流、终端编程、复杂图表理解和跨学科推理都超过了 GPT-5.6 Sol。知识工作、通用 Agent 和电脑操作仍然落后,这块还谈不上横扫。
⚠️ 价格提醒每百万 Token 输入 0.75 美元,输出 3.75 美元。这是 2026 年底前的推广价,2027 年将涨到 1.50 美元和 7.50 美元。
不过 Google 自己也提醒了一句:高推理档位会多思考、多调用工具。单价低,不保证每个任务的总成本都低。便宜模型认真加起班来,也会吃 Token。
还有一个安全专用版
Gemini 3.8 Flash Cyber 专门负责发现漏洞和自动打补丁。Google 称,它在覆盖 20 种编程语言的内部测试中,漏洞发现成功率超过 70%;在 CWE-Bench 上,修复能力已经贴近领先模型。
不过普通开发者暂时用不到。它只通过 Fairwind Program 向政府机构、关键基础设施运营方和可信软件维护者开放,也没有公布独立的公开 API 价格。
02Muse 到了什么水平
![]()
▲ 图:Artificial Analysis Intelligence Index v4.1.1,2026 年 9 月 2 日
再看 Muse。
Artificial Analysis 把九类测试合成一个综合指数,既看知识和推理,也看编程、工具使用与长文本处理。它有点像模型的综合考试,比盯着某一门单科更能看出整体水平。
在这张全模型榜单里,Muse Spark 1.3 的 max 档与带 Tool Fallback 的 Claude Fable 5 处在同一水平。Tool Fallback 可以简单理解成:遇到合适的问题时,模型能借助工具完成任务。
Muse 只落后于 Fable 5.1 和 Claude Opus 5,已经站到最前排。
上一代 Muse Spark 1.2 还和一批中上游模型挤在一起,1.3 直接跳到了 Fable 5 旁边。Google 的 Gemini 3.8 Flash 也进入前十。最近这一波更新,榜单前排已经挤得像晚高峰地铁。
有一点要说清楚:Muse Spark 1.3 的 max 档还在做额外安全测试,发布当天尚未开放。眼下可以直接调用的是其他推理档位。
![]()
▲ 图:Meta 公布的 Muse Spark 1.3 Benchmark 表
我再翻 Meta 自己的测试表,发现这次提升很集中:把长任务做完。
长程软件工程比 1.2 提升约20 个百分点,电脑操作提升约 19 个百分点。面对 50 万到 100 万 Token 的超长上下文,检索能力提升超过 40 个百分点。
长程软件工程测试看它能不能接手一个完整代码任务;电脑操作测试看它会不会点击、输入并在多个软件之间切换;超长上下文测试则像把一本巨厚资料塞进去,再让它准确找回其中一个细节。
Muse Spark 1.3 在这些关键项目里多数超过 GPT-5.6 Sol,终端编程与它持平;综合能力则对标 Fable 5。
普通用户可以把它理解成:已经有能力连续处理一项复杂工作,而不只是在对话框里回答几个问题。
编码效率同样有改善。Meta 内部比较显示,相较 1.2,新版平均少用约 20% 的工具调用和 25% 的 Token。能力涨了,干活反而更省,这才是 Agent 最实在的升级。
Meta API 价格标准版每百万 Token 输入 1.25 美元、输出 4.25 美元。Contributor 版只要 0.10 美元和 0.20 美元,但需要允许 Meta 使用输入和输出数据改进模型。
Contributor 的折扣很凶,代价也写在小字里。代码、客户资料和内部文档比较敏感的话,这个价格看看就好。
Muse Spark 1.3 已进入 Muse Code 和 Meta Model API。Meta 还预告了更大的模型和开放权重版本,目前都没有具体时间。
03国外模型也卷起来了
过去几个月,AI 圈最热闹的画面一直在国内。DeepSeek、千问、GLM、Kimi、MiniMax 轮番更新,价格往下压,能力往上抬,隔几天就有人改一次榜单。
国外这边反而相对平静,尤其是 Google 和 Meta,一度给人一种已经从最激烈的模型竞赛里退下去的感觉。
结果这周,两家全回来了。
美国甚至还在周三。Anthropic、Google、Meta 已经连续放出了 Claude Fable 5.1、Gemini 3.8 Flash 和 Muse Spark 1.3。
三家公司,两天左右,三款新模型。
Google 用一个低价快速型号,在多项测试里超过 GPT-5.6 Sol;Meta 上一版还不算突出,这一版直接冲到 Fable 5 的综合水平。
原本被认为落后的两家公司,一夜之间又挤回了第一梯队。
这才是我觉得最夸张的地方。以前一个模型领先,优势还能维持几个月。现在一次更新就可能把差距抹掉,榜首甚至撑不过一天。谁都不敢停,停一下,下一个排行榜可能就掉队了。
现在还没有正式出牌的,似乎只剩 OpenAI。市场传言 GPT-6 可能也会在本周出现,一场好戏又等着上演了!
参考资料
https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/ https://research.meta.ai/blog/introducing-muse-spark-1-3 https://www.anthropic.com/claude-fable-and-mythos-5-1 https://dev.meta.ai/docs/pricing-rate-limits/ https://artificialanalysis.ai/models/muse-spark-1-3 https://www.axios.com/2026/09/01/openai-astras-cyber-critical
Muse Spark 1.3 这次追到 Fable 5,你觉得 Meta 真回来了,还是先等实测?
觉得有用 → 点个❤️在看转给朋友
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.