继 Anthropic 和 之后,Meta 也加入了本周这场大模型密集发布潮。
就在刚刚,Meta 正式发布 Muse Spark 1.3,新模型当天开始登陆 Muse Code 和 Meta Model API。
相比上一代 Muse Spark 1.2,Meta 将升级重点放在Agent 长任务、编程、多任务处理和复杂指令遵循上,同时进一步降低了模型完成工程任务时需要消耗的工具调用和 Token 数量。
![]()
扎克伯格随后在 X 上表示,Muse Spark 1.3 是 Meta 目前在编程和 Agent 工作上幅度最大的一次升级,并形容其已经获得接近前沿模型的性能,同时价格「低到几乎可以忽略不计」。
![]()
按照 Meta 的规划,Muse Spark 1.3 还只是这一轮模型更新的开始。更大的 Muse 模型、Muse Spark 开放权重版本都已经进入后续发布计划。
Meta 的个人 Agent 野心,藏在 Muse Spark 1.3 里
Muse Spark 1.3 最明显的变化,出现在长时间运行的 Agent 工作流上。
![]()
Meta 希望模型在面对开放式任务时,不再只完成一连串预设步骤,而是能够自己使用工具收集上下文,从杂乱甚至互相冲突的信息中整理线索,发现计划存在缺口以后主动调整,同时持续记录已经获得的信息,直到生成最终交付物。
为了提高模型对不同 Agent 环境的适应能力,Meta 表示,Muse Spark 1.3 在多种不同的 Agent harness 中进行了训练,希望模型离开固定工具链之后依然能够维持相近的工作能力。
![]()
用户与 Agent 的协作方式也发生了变化。
面对含义不明确的 Prompt,Muse Spark 1.3 会更主动地询问用户;任务进行不下去时,也会向用户寻求帮助;涉及不可逆或者影响较大的操作时,则会在执行之前确认。
长任务期间,模型还能根据用户偏好调整工作方式。有些用户希望不断看到进度更新,模型可以持续汇报;另一些用户希望减少打扰,它也可以降低通知频率,持续完成任务。
Meta 还专门强化了模型对自身能力边界的判断,希望它能够更准确地区分自己「知道什么、不知道什么、能够做什么、做不了什么」,遇到障碍时明确表达,而不是虚构已经完成的结果。
复杂指令遵循同样是升级重点。Muse Spark 1.3 在包含大量限制条件的多步骤任务中,更容易持续记住前文要求,减少任务进行到后半段以后遗漏条件或者偏离原有流程的问题。
![]()
Meta 展示的一个案例是一份航空工程报告。模型需要同时读取 CFD 仿真数据和 STEP 格式的机翼 CAD 文件,整理计算域、网格、材料属性、边界条件和收敛目标,提取速度、湍流强度、动能以及机翼受力等数据,再分析升阻力、激波、流动分离和湍流现象,最后按照指定章节生成并导出 PDF。
![]()
类似任务反映出 Meta 对 Agent 的定位正在发生变化。
单次回答已经不足以代表模型能力,能否在一个持续很长时间、资料复杂、要求不断变化的任务中保持状态,开始成为下一阶段模型竞争的重要指标。
Meta AI 负责人 Alexandr Wang 在接受外媒 Axios 的采访时表示,Muse Spark 1.3 在这一方向上的改进,会直接服务于扎克伯格此前多次谈到的个人 Agent,也就是能够长期代表用户工作,持续帮助用户完成目标的 AI 系统。
Coding Agent 继续变强,也开始认真算成本了
编程能力是 Muse Spark 1.3 另外一个重点升级方向。
Meta 表示,新模型增加了大量长时间编程任务训练,并针对日常工程工作中的可用性进行了优化。相比 Muse Spark 1.2,它会减少不必要的对话轮次,回复更加克制,生成代码的整体风格也更加干净。
![]()
Meta 工程师进行的内部比较显示,Muse Spark 1.3 完成相同任务时平均减少约 20% 的工具调用,同时减少约 25% 的 Token 消耗。
![]()
对于正在向 Agent 编程演进的 AI Coding 产品而言,这两个数字比单纯提高 Benchmark 分数更具有实际意义。
当前不少 Coding Agent 会在一个任务中反复搜索文件、调用终端、修改代码、重新测试,一个看似简单的需求可能产生几十甚至上百次工具调用。
模型能力提升之后,如果完成任务需要的调用次数下降,意味着等待时间、推理成本和 API 消耗都有机会同步降低。
![]()
参与 Muse Spark 1.3 研发的北大校友孙之清(去年加入 Meta)也在模型发布之后发文打 call,并透露了一些研发侧的信息。
他表示,团队这次再次对 Avocado 模型进行了后训练,同时进一步强化了测试时扩展能力,并评价新版本相比前代在各个方面都有明显提升。
此外,Meta 还在通过另一种方式继续降低 Muse Code 的使用成本。
开发者如果同意 Meta 使用自己的代码和工作数据训练、改进模型,就可以加入所谓的 contributor tier,以明显更低的价格使用产品。Wang 表示,目前已经有「具有实际规模的两位数比例」开发者选择了这一方案。
![]()
背后的逻辑并不复杂。Meta 手里拥有庞大的算力基础设施,也需要大量真实开发场景数据继续提升 Coding Agent,如果能够用更低的订阅价格交换模型改进所需的数据,Muse Code 就有机会同时获得用户规模和训练数据。
当然了,模型能够连续工作更长时间以后,安全问题的重要性也随之提高。
不过正如 Wang 所说,Meta 目前还没有因为安全问题暂停模型研发,公司采取的方式是增加安全与 Alignment 投入,尽量避免后续模型触碰内部设定的安全限制。
Muse Spark 1.3 当前已经提供此前开放的推理模式,更高计算量的 max reasoning 版本仍需要完成额外安全测试,随后才会发布。
本周依然是神仙打架的一周,几乎每天醒来都有新模型发布,且涵盖不同的中杯、大杯和超大杯模型。
![]()
昨天,Anthropic 更新了 Fable 和 Mythos 系列;Google 发布 Gemini 3.8 Flash 和面向网络安全任务的专用版本;OpenAI 也确认 Astra 即将推出。
Meta 需要面对的已经不只是单项 Benchmark 竞争,还有前沿实验室正在同时争夺 Coding、Agent、长上下文、工具调用和单位成本。
![]()
更有意思的是,Meta 新模型发布之后,Meta AI 负责人 Alexandr Wang 也没忘记给这场竞争再添点火药味。他对着 贴脸玩梗:「我真不想这么说,但是……Gemini 是谁?」。
真就 ·与其提升自己,不如诋毁对手。
我们正在招募伙伴
简历投递邮箱hr@ifanr.com
✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.