独立评测机构Artificial Analysis最新数据显示,Anthropic的旗舰模型在综合知识、编程、科学推理与事实准确性等九项测试中拿下61分,将Fable 5(60分)、GPT-5.6 Sol(59分)等对手甩在身后。该成绩是在模型公开发布前,由评测方与Anthropic合作完成的。
编程对决中,这款新模型在“xhigh”推理等级下配合Claude Code,于Artificial Analysis编程指数上并列第一。而在模拟真实终端环境的Terminal-Bench v2.1中,“max”设定使其斩获89%的成绩,追平了此前的领头羊GPT-5.6 Sol。
![]()
科学推理层面,它在涵盖多学科的高难度测试Humanity's Last Exam中拿到53%,与Fable 5持平。在阿贡国家实验室与伊利诺伊大学香槟分校构建的物理基准CritPt上,该模型同样和Fable 5打成平手,但仍落后于GPT-5.6 Sol、GPT-5.5 Pro与GPT-5.6 Terra。
事实准确性却是明显短板。在AA-Omniscience检测中,尽管得分较上代提升了7个点,仍不敌Fable 5。更棘手的是,模型在不确知时更倾向直接作答,导致幻觉率猛增14个百分点,达到50%。
Epoch AI的评测结果进一步勾勒出竞争态势:Claude新旗舰的整体能力指数得分为159,略低于Fable 5的161分。但若只看软件工程基准SWE-ECI,它与Fable 5同为161分,优于GPT-5.6 Terra和上代Claude旗舰。GPT-5.6 Sol则在两项指标上均保持领先。
这场前沿模型竞赛的胶着状态已被坐实——没有哪一款能建立清晰优势,这为“AI模型终将走向商品化”的论点增添了分量。
成本端是该模型另一张牌。在智能指数测试中,单任务平均开销仅2.03美元,低于带后备方案的Fable 5(2.75美元),但高于上代旗舰的1.80美元和Sonnet 5的1.53美元。在“high”和“xhigh”两个推理等级上,它的表现均优于上代及Sonnet 5,且成本更低。
Vals.ai借助面向编程的Vibe Code Bench,在五个推理等级上对其进行了测试。得分从“low”的76.7%升至“medium”的82%,再到“high”的89.8%,但随后在“xhigh”(88.3%)和“max”(88.4%)两个最高档位出现回落。
这两个高档位的成本反而高出许多。Vals.ai发现,更高的推理等级倾向于产出更复杂也更容易出错的方案,而“high”等级生成的方案更简洁,能更可靠地满足需求。Terminal-Bench 2.1也呈现类似规律。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.