网易首页 > 网易号 > 正文 申请入驻

AI巨头又开始“互卷”!Google、Meta同时出手:Gemini 3.8、Muse Spark 1.3重磅发布

0
分享至

整理 | 屠敏

出品 | CSDN(ID:CSDNnews)

这两天,AI 领域热闹非凡,大模型市场迎来了一轮密集更新。

9 月 1 日,Anthropic 刚刚发布 Claude Fable 5.1 和 Claude Mythos 5.1,主打编码、知识工作和长时间 Agent 任务。紧接着,Google 和 Meta 也在同一时间带来新模型:Google 推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,Meta 则发布 Muse Spark 1.3。

短短几天,三家头部 AI 公司接连出手,而且不约而同地把重点放在了编码、Agent 和复杂任务执行上。大模型的竞争,正在从单纯比拼“谁的回答更聪明”,进一步转向比拼谁能真正把事情做完。


仅三周,Gemini 3.8 Flash 就来了

回看 Gemini 3.7 Flash 版本的发布,也只不过是三周前的事情。

如今 Google 加快了模型版本迭代的步伐,最新带来了 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。官方表示,这是目前最智能的 Flash 模型,重点提升软件工程、Agent 任务和多步骤推理能力。


其中,Gemini 3.8 Flash 最大的特点,是在保持 Flash 系列速度和成本优势的同时,开始向更高能力的模型靠近。


它支持 100 万 Token 上下文,输入价格为每百万 Token 0.75 美元,输出为3.75 美元。模型还支持低、中、高三档 thinking 强度,可以在性能、延迟和成本之间进行调整。

在 DeepSWE v1.1 这一长程软件工程测试中,Google 自己公布的数据显示,Gemini 3.8 Flash 可以自主处理复杂工程问题。


在 Vals Finance Agent V2 和 Harvey’s Legal Agent Benchmark 等专业 Agent 测试中也超过上一代。HLE-Verified 得分则达到 54.9%,证明了其能够处理 STEM、人文和专业领域的多步骤推理。


第三方测试同样给出了不错的结果。

Artificial Analysis 测试显示,Gemini 3.8 Flash 在最高推理强度下拿到 59分,比 Gemini 3.7 Flash 的 56 分提高 3 分;中等推理强度为 57 分,低推理强度为 52 分。

这与 Anthropic 的 GPT-5.6 Sol和 SpaceXAI 的 Grok 4.6 仅差一点。


不过,Google 也很坦率:3.8 Flash 会“想得更多”。

在处理复杂任务时,这款模型会表现得更加细致,会增加推理步骤,并反复调用工具。有时,为了尽可能提升任务表现,模型会消耗更多 Token,尤其是在更高推理强度下。

Google 对此建议道:对于算力效率是首要考量的应用场景,开发者可以选择较低的推理强度,以减少 Token 开销;也可以继续使用 Gemini 3.7 Flash。后者目前仍得到完整支持,适合那些更看重效率和成本的工作负载。


Gemini 3.8 Flash Cyber:Google 把网络安全单独拎出来

随着 Gemini 3.8 Flash 一起发布的,还有 Gemini 3.8 Flash Cyber,同样值得关注。

这个版本不是面向普通用户的“加强版 Gemini”,而是专门用于网络安全防御,目前通过 Google 新推出的 Fairwind Program 提供给一组受信任的防御者。

Google 重点测试了两个能力:发现漏洞和自动修复漏洞。

在用于查找漏洞的行业标准基准测试 CyberGym中,Gemini 3.8 Flash Cyber达到前沿水平,并超过了 Gemini 3.5 Flash Cyber 以及更大的模型。


在 CWE-Bench 漏洞修复测试中,模型 pass@1 达到 47.2%,与领先前沿模型的 47.8% 非常接近,但 Google 强调其成本明显更低。更直接的例子来自实际使用:Chrome 安全团队发现,3.8 Flash Cyber 生成的正确漏洞补丁数量,是体量更大的商业模型中最佳结果的 2.6 倍。


Google 还披露,Cloud Vulnerability Research 团队利用该模型在不到 2 小时内发现了一个关键基础漏洞,而这类漏洞通常可能需要数月研究。

当然,这一能力也意味着更严格的访问控制。Google 表示,Gemini 3.8 Flash 已经加入针对网络攻击和 CBRN 相关滥用的安全措施,而 Cyber 版本因为需要提供更完整的网络安全能力,因此只开放给可信防御方。


Meta Muse Spark 1.3 同台竞技,Alexandr Wang 调侃:“Gemini 是谁?”

同一天,Meta AI Research 也拿出了 Muse Spark 1.3,是继今年 8 月发布 Muse Spark 1.2 后,短时间内再次升级的一代模型。

一直热衷于为自家模型“站台”的 Meta AI 负责人 Alexandr Wang,在新模型发布后也不忘调侃一番,直接在社交平台上发问:“我真不想这么说,但是……Gemini 是谁?”


相比 Google 和 Anthropic 此前更明显的模型升级,Meta 这次并没有改变 Muse Spark 的定位,而是继续围绕 Agent 和编程能力加码。

官方表示,Muse Spark 1.3 重点提升了 Agentic 任务和编程任务的表现,并针对真实使用场景进行了大量优化,让模型不仅在测试中表现更好,也能更稳定地处理需要多步骤执行的复杂任务。


详细来看,Muse Spark 1.3 针对 Agent 和编码任务进行了优化,可以在一个较长的对话线程中同时处理多个工作流。面对开放式任务,它能够利用工具收集上下文、发现计划中的缺口并主动修正,同时在任务过程中记住已经获得的信息。

这种能力在实际工作中尤其重要。比如用户要求模型根据 CFD 仿真数据和 CAD 文件制作一份航空工程报告,Muse Spark 1.3 不仅需要读取不同类型的输入,还要提取仿真数据、整理性能指标、生成表格、分析气动性能,最后按照指定结构输出 PDF。


Meta 展示的另一个案例则要求模型处理音频工程任务,根据时间码定位贝斯轨道中的错误音符、噪声和爆音,再完成编辑和混音。


在与用户协作方面,Muse Spark 1.3 也进行了优化。面对存在歧义的要求,模型会主动请求澄清;执行过程中遇到无法解决的问题时,也可以向用户寻求帮助,并在执行重要操作前进行确认。

对于长时间任务,它还可以根据场景选择持续汇报进度,或者尽量减少打扰,在后台完成工作。

编程也是此次升级的重点。Meta 表示,Muse Spark 1.3 针对长周期编码任务和常见软件工程工作流进行了优化,在没有必要的情况下会减少交互轮次,同时让代码更加简洁。

根据 Meta 工程师的测试,在相同类型的任务中,Muse Spark 1.3 相比 Muse Spark 1.2 的工具调用次数减少约 20%,Token 使用量减少约 25%。这意味着新模型并非单纯依靠更多推理和工具调用完成任务,而是在减少无效操作的同时提高执行效率。


安全方面,Muse Spark 1.3 也针对 Agent 和编码场景进行了优化,包括增强对抗恶意输入和 Prompt Injection(提示词注入)的能力,并改进对高风险、不可逆操作的判断,在必要情况下会暂停执行并请求用户确认。

目前,Muse Spark 1.3 已经上线 Muse Code 和 Meta Model API。此前提供的推理模式现已开放,而更高强度的 Max Reasoning 模式将在完成额外安全测试后推出。

对于这一新版本,Alexandr Wang 表示,这一升级也是 Meta 继续推进“个人 Agent”的一部分,目标是让 Agent 未来能够长期运行,替用户完成任务。


不同模型碰到一起,真正比的是“干活能力”

事实上,把这几款模型放在一起看,会发现一个很明显的变化。

这轮新品已经很难单纯用“谁的模型更聪明”来概括。

Claude Fable 5.1 目前在 Artificial Analysis 综合智能指数上以 66 分排名第一,它的优势集中在复杂推理、编码和专业知识工作,但最高强度下也会消耗大量 Token。

Gemini 3.8 Flash 则更像一个高性价比的“工作马”。最高推理强度下达到 59 分,开发者还可以主动降低 thinking 强度,把单任务成本进一步压低。

Muse Spark 1.3 则把重点放在长任务执行效率上。它不只是提高模型本身的能力,还试图让 Agent 少调用几次工具、少消耗一些 Token,并在复杂任务中更好地保持上下文和执行约束。

这也是为什么最近模型发布越来越频繁,却越来越不像过去那种简单的“刷榜”。


模型已经开始进入一个新的竞争阶段:不仅要回答得对,还要能连续工作;不仅要能写代码,还要能自己运行、测试和修改;不仅要完成任务,还得控制完成任务的 Token 和时间成本。

从这个角度看,Anthropic、Google 和 Meta 这几款新品虽然走的是不同方向,但最终瞄准的是同一个问题——当大模型不再只是聊天机器人,而是开始真正替用户执行任务时,谁能让它们干得更久、更稳、更快,而且成本还能接受。

接下来大模型赛道的竞争真正值得看的,可能已经不是下一款模型能把榜单提高几分,而是这些模型进入真实工作流之后,究竟谁能最先把“Agent 自己干活”从演示变成日常工具。

参考:

https://research.meta.ai/blog/introducing-muse-spark-1-3

https://x.com/ArtificialAnlys/status/2095247787277553929/photo/1

https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

https://artificialanalysis.ai/articles/gemini-3-8-flash?utm_source=chatgpt.com

https://artificialanalysis.ai/-breakdown

文末福利|AI 开学季硬核资料免费领

2026 奇点智能技术大会限时送出两份技术礼包:

Łukasz Kaiser 历届演讲视频 + PPT

Transformer 八子之一、OpenAI 资深研究科学家,带你理解推理模型与大模型第一性原理。

Agent 实战训练营录播课

覆盖 Agent 架构、基座模型、Skill、Agentic Infra 等核心技术,从理论到企业级落地。

扫码免费领取,两套硬核资料一次带走。

11 月 20—21 日

北京万达文华酒店

2026 奇点智能技术大会,现场见。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
拿筷子姿势恶心死了!一段贫民窟小公主吃饭视频,给网友看力竭了

拿筷子姿势恶心死了!一段贫民窟小公主吃饭视频,给网友看力竭了

世界圈
2026-09-28 15:04:12
梅根彻底“暴怒”!公开警告威廉凯特:别插手我们的事

梅根彻底“暴怒”!公开警告威廉凯特:别插手我们的事

小武侃风云
2026-09-29 15:21:08
2026款起亚K5:内饰质感越级,但缺少混动是短板

2026款起亚K5:内饰质感越级,但缺少混动是短板

报错免疫体
2026-09-30 00:10:30
血管科专家:最养心脏的5种食物,天天吃,让心脏越来越有力

血管科专家:最养心脏的5种食物,天天吃,让心脏越来越有力

路医生健康科普
2026-09-29 18:10:03
又一地产大佬被限高,曾是“深圳富豪团”带头大哥

又一地产大佬被限高,曾是“深圳富豪团”带头大哥

评论员岳连
2026-09-29 19:05:41
威少澳门度假,吃路边摊,逛服装店,退役享受生活,十分接地气

威少澳门度假,吃路边摊,逛服装店,退役享受生活,十分接地气

大西体育
2026-09-29 15:31:59
RMC:梅罗生涯暮年境遇各不相同,两人性格决定最终选择

RMC:梅罗生涯暮年境遇各不相同,两人性格决定最终选择

懂球帝
2026-09-30 00:42:07
上千辆导弹发射车频繁机动,数百个弹道导弹发射井全部启封,谁敢动?

上千辆导弹发射车频繁机动,数百个弹道导弹发射井全部启封,谁敢动?

聚峰军评
2026-09-29 11:40:09
原来很多父母从来不教生活常识!网友:什么都是自己慢慢摸索!

原来很多父母从来不教生活常识!网友:什么都是自己慢慢摸索!

另子维爱读史
2026-09-29 21:06:47
6号线开通,让南京地铁站里藏进一片地下枫林

6号线开通,让南京地铁站里藏进一片地下枫林

现代快报
2026-09-29 14:44:58
抗战中最特殊的战役:我军唯一一次拥有装备优势,用钢铁洪流碾压日军

抗战中最特殊的战役:我军唯一一次拥有装备优势,用钢铁洪流碾压日军

郁郁乎文
2026-09-29 20:54:39
《给阿嬷的情书》淑柔也进圈了,王晓慧被曝签约大厂,和马伊琍、王彦桐成同事

《给阿嬷的情书》淑柔也进圈了,王晓慧被曝签约大厂,和马伊琍、王彦桐成同事

娱君坠星河
2026-09-29 11:36:02
知名大学原党委书记,被“双开”

知名大学原党委书记,被“双开”

双一流高校
2026-09-29 01:08:36
阿斯:皮克因通道不当行为被停赛6场、禁赛2个月

阿斯:皮克因通道不当行为被停赛6场、禁赛2个月

懂球帝
2026-09-29 09:33:03
黄晟豪:我最大愿望就是早点挣钱,给家人换一套大一点的房子

黄晟豪:我最大愿望就是早点挣钱,给家人换一套大一点的房子

体育全天候
2026-09-29 17:31:18
通透!西班牙记者彻底看穿C罗内心:不惜一切代价,也要凑够千球

通透!西班牙记者彻底看穿C罗内心:不惜一切代价,也要凑够千球

安逸安逸
2026-09-29 13:52:57
一对情侣亲密时,男的不愿带小雨伞,女的也没强迫男的穿

一对情侣亲密时,男的不愿带小雨伞,女的也没强迫男的穿

趣味萌宠的日常
2026-08-24 06:38:53
已售超70万份,鲍师傅60厘米超长蛋挞被吐槽“全是皮没蛋液”,客服:将优化产品

已售超70万份,鲍师傅60厘米超长蛋挞被吐槽“全是皮没蛋液”,客服:将优化产品

齐鲁壹点
2026-09-29 07:05:12
房价大局已定?要是不出意外,2027年起房地产可能迎来3大变化

房价大局已定?要是不出意外,2027年起房地产可能迎来3大变化

无情有思ss
2026-09-29 09:01:49
朱亚文凭《太平年》获金鹰奖最佳男配角!喜提首座主流奖项

朱亚文凭《太平年》获金鹰奖最佳男配角!喜提首座主流奖项

小椰的奶奶
2026-09-29 23:46:04
2026-09-30 01:00:49
CSDN incentive-icons
CSDN
成就一亿技术人
27004文章数 242338关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

老人在景观桥上被虎头蜂蜇伤离世 家属:无人愿意担责

头条要闻

老人在景观桥上被虎头蜂蜇伤离世 家属:无人愿意担责

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

央行调整完善若干货币政策工具

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

手机
教育
亲子
数码
军事航空

手机要闻

总分屈居第二 但视频独一档!iPhone18 Pro的视频实力依旧没人能追上

教育要闻

划片没变,老师先动了:成都今天官宣6个学区试点,家长群吵翻的3个问题一次说清

亲子要闻

“带娃上班”出圈背后,职场育儿路在何方?

数码要闻

iQOO16发布:国补5499元起 首发2K 165Hz三星珠峰屏

军事要闻

伊朗最高领袖最新发声:伊朗现已变得独立、强大

无障碍浏览 进入关怀版