周五的这场突然发布,Opus 5究竟靠什么掀翻了AI圈的话筒? Anthropic在罕见的周五档期放出了Claude Opus 5,官方给出的说法是“接近Fable”,尽管多数自家基准测试中Opus 5已技术上超越Fable。Anthropic解释,这是因为现有评测难以捕捉Fable独有的“大模型气息”,而这种气质目前还无法量化。 但独立机构的测评很快把故事讲得更具体。Artificial Analysis将Opus 5送上了其知识工作代理基准AA‑Briefcase的头把交椅,分数比Claude Fable 5高出近150 Elo,同时单任务成本还下降了20%。效率方面也有意思——Opus 5勉强追平了GPT‑5.6 Sol。 Epoch给出的编码智能指数(ECI)则带了点保留:Opus 5综合ECI为159,略低于Fable 5的161,不过在软件工程专项SWE‑ECI上打成了161平手。这组数字立刻引来质疑,有人直指ECI“严重低估”了Opus 5的实际提升,因为它表面只比Opus 4.8高1分,现实里却“做什么都强得多”,并呼吁拿出更难的公开基准。 另有一条技术线索加剧了对基准本身的讨论:Opus 5在FrontierCode中等推理投入下的得分反而超过高投入,完全不符合算力越多表现越好的常理,暗示任务特定的搜索策略或评测波动可能在作祟。 落到真实使用场景,编码能力是最先被验证的环节。前Bing负责人Mikhail Parakhin用“Best‑of‑n rules”来形容Opus 5,称它在数学和几乎所有任务上正面击败了Fable,唯一的遗憾是还没进Codex。Chatbot Arena也放出了首轮用户体验的预告,表示基于真实世界的排行榜分数很快会出炉。 从发版第一天看,Opus 5不再只是Fable的平替——它用更低成本给出了更锋利的代理工作能力,虽然基准争议仍在,但一线工程师的回购式好评,或许才是Anthropic真正想要的验证。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.