这个夏天结束了,AI圈却比任何时候都热。Wolfram在节目开场第一分钟就说了这句话,事实证明他说得没错——过去48小时里,Anthropic、Meta、Google、Z.ai四家实验室像约好了一样,赶在OpenAI发布Astra之前,把压箱底的东西全掏了出来。
Anthropic的Fable 5.1率先登场,成为当时最强的LLM。Meta的Muse Spark 1.3紧随其后,在Artificial Analysis指数上追平了Fable 5,价格却只要五分之一。Google又发了一个Flash,这次是3.8版本。Z.ai把GLM-5.3的完整权重放了出来。还有三家实验室发布了能实时运行的世界模型。
![]()
Fable 5.1:修掉了"术语装逼"问题
Fable 5.1和Mythos是同一套权重,Fable是实际开放给用户的那一个。Anthropic给出的数据很能打:Terminal-Bench 4.0从Fable 5的42.0%涨到55.8%,Terminal-Bench Science翻倍到52.6%,SWE-bench Pro达到81.2。
价格维持在每百万token 10美元和50美元,但真正让做agent的人兴奋的是缓存读取价格——降了75%,到每百万token 0.25美元。Anthropic说这能让典型工作负载便宜约25%,重度agent场景最多便宜45%。不过这个说法没被验证,还有人抱怨配额被消耗得太快。
Peter实际跑下来的数据是另一回事:他在Code Arena上的前端生成,每次要花40到60美元,而Sol只要3到10美元。但Max版本在Code Arena上仍然以大比分领先。他的观点和我一致:有了这样的模型,我们应该想得更大、更敢想。
Anthropic终于承认了"矫揉造作文风"
几个月来我一直在吐槽Opus 5的说话方式——什么都"承重",什么都"控制平面",什么问题都是"痛点"。我管这叫"术语装逼"。这次Fable 5.1不仅修了这个问题,Anthropic还给了它一个正式名字:矫揉造作的散文(mannered prose),并且附上了修复方案。
这周我自己的体验是:用Fable 5.1,花了大约四个小时就搭好了一个直播工作室,带实时转录和agent制片人。放在以前,这活儿得干好几天。
这波密集发布背后,各家显然都在抢时间窗口。Astra还没落地,赛道已经挤成这样了。接下来就看OpenAI怎么接招。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.