网易首页 > 网易号 > 正文 申请入驻

Claude Opus 4.8 发布 72 小时,第一份独立成绩单来了!编程碾压,全科第四

0
分享至

来源:市场资讯

(来源:AI信息Gap)

Anthropic 说,七项测试六项第一。

LiveBench 说,你排第四。

Claude Opus 4.8 上线 72 小时,独立评测机构的成绩单陆续出炉。Artificial Analysis 综合智能指数第一,LiveBench 全科排名第四。同一个模型,两份榜单,不同的故事。


今天这篇,我们只看第三方独立评测数据。

Claude Opus 4.8 在编程领域的统治力,没有争议。

SWE-Bench Pro 69.2%,GPT-5.5 58.6%,Gemini 3.1 Pro 54.2%。超过 10 个百分点的差距,在这种难度的基准里,基本等于代差。

不过 LiveBench 的编程子项,画面稍有不同。Coding Average 上 GPT-5.5 82.47,Claude Opus 4.8 79.27,OpenAI 反而领先。Agentic Coding 子项里 Claude 拿了 60 分,赢了 GPT-5.5 的 56.67,但落后于 GPT-5.4(70)和 Gemini 3.1 Pro(65)。


Artificial Analysis 的 GDPval-AA 真实工作评测给出了更极端的数据。1890 Elo 分,领先 GPT-5.5 121 分。换算成胜率,大约 67% 的概率赢 GPT-5.5。而且完成同等任务,Opus 4.8 比 4.7 少用了 35% 的输出 token,对话轮次也减少了 15%。


干活更快,还更省。

但全科排名,故事就不一样了。

LiveBench 是一套专门针对「数据污染」设计的评测。题目定期更新,答案可验证,不需要 LLM 当裁判。入选了 ICLR 2025 Spotlight Paper,最近一次题库更新是 2026 年 1 月 8 日。

在 LiveBench 全科排名里,Claude Opus 4.8 Thinking xHigh Effort 综合得分 77.22。

排在它前面的有三个模型。

GPT-5.5 Thinking xHigh Effort,80.71。第一。

GPT-5.4 Thinking xHigh Effort,80.28。第二。

Gemini 3.1 Pro Preview High,79.93。第三。

Claude Opus 4.8,第四。

和第一名 GPT-5.5 差了 3.49 分,和第三名 Gemini 3.1 Pro 差了 2.71 分。

数学(Mathematics Average),GPT-5.5 96.32,Claude Opus 4.8 84.32。差了 12 分。GPT-5.4 和 Gemini 3.1 Pro 分别是 94.15 和 91.04,都在 Claude 前面。

指令遵循(IF Average),Gemini 3.1 Pro 79.10,GPT-5.5 73.04,Claude Opus 4.8 67.45。Claude 在这项上的差距更大。

推理(Reasoning Average)是 Claude 的强项。Claude Opus 4.8 89.71,仅次于 GPT-5.4 的 88.12,超过了 GPT-5.5 的 87.71。

编程(Coding Average)GPT-5.5 82.47,Claude Opus 4.8 79.27。LiveBench 的编程测试里 GPT-5.5 更强。这和 SWE-Bench Pro 的结果不完全一致。

Artificial Analysis 则给出了一个不同的全科排名。

在他们的综合智能指数(Intelligence Index)里,Claude Opus 4.8 拿下 61.4 分,超过 GPT-5.5 的 60.2 分,登顶第一。比上一代 Opus 4.7 提升了 4.1 分。


这个指数覆盖 GDPval-AA、Humanity's Last Exam、Terminal-Bench、SciCode 等多个维度。Claude 在 GDPval-AA(真实工作任务)和 HLE(跨学科极难题)上的优势太大,拉高了总分。

Humanity's Last Exam,Claude Opus 4.8 领先一个百分点。这个基准包括全球专家出的 2500 道题,三家跑出来差距只有 1-2 个百分点,可以算是贴身肉搏。

科学推理也有进步。在 CritPt(物理学前沿评测)上超过了 Gemini 3.1 Pro,但仍然落后于 GPT-5.4 Pro(30.0%)和 GPT-5.5 Pro(30.6%)。

幻觉率维持在 35.9%,在「诚实、不瞎编」这件事上 Claude Opus 4.8 做得确实不错。

LMArena 目前还没有 Opus 4.8 的排名数据。毕竟模型上线才 72 小时,投票样本还不够。上一代 Opus 4.7 Thinking 在 Coding Arena 排第一,Text Arena 排第二(低于上上代的 Opus 4.6 Thinking)。Opus 4.8 的具体数据大概率还要等一到两周。


Terminal-Bench 2.1,GPT-5.5 78.2%,Claude Opus 4.8 74.6%。命令行操作这个场景,OpenAI 还是第一。但比 Opus 4.7 的 66.1% 进步了 8.5 个百分点,差距在缩小。

GPQA Diamond(研究生级别科学推理),御三家都在 93-94% 区间。这个榜单快饱和了,拉不开差距。

榜单看完了,来说结论。

编程和 Agent 方向,Claude Opus 4.8 理论上是当前最强,但 GPT-5.5 和它相比,差距不算大。

如果看全科综合能力,LiveBench 的数据更为客观。GPT-5.5 各方面更均衡,Gemini 3.1 Pro 在语言和指令遵循上更强。

Claude Opus 4.8 还是那个偏科生。

Opus 4.8 上线当天,就有用户发现通过 API 调用时,模型会自称「通义千问」或「DeepSeek」。

三个月前,Anthropic 公开指控 DeepSeek、月之暗面和 MiniMax 对 Claude 发起「工业规模的蒸馏攻击」,声称有 2.4 万个虚假账户进行了超过 1600 万次交互。

三个月后,自家新模型在中文场景下「自曝」了。

Anthropic 官方至今没有回应。

不管是什么原因,这件事和成绩本身无关。但它给「反蒸馏」叙事增添了一丝尴尬。你指控别人偷你的数据,结果你的新模型开口第一句就是别人的名字。

a16z 联合创始人 Marc Andreessen 在社交媒体上吐槽,「如果蒸馏算犯罪,那人类历史上每一次师徒传承、每一场学术研讨会,是不是都该被起诉?」

42 天出一代新模型,编程能力甩开第二名 10 个百分点,真实工作评测登顶。

代价是全科排名第四,语言、数学和指令遵循的短板还没补上来。

我是木易,Top2 + 美国 Top10 CS 硕,现在是 AI 产品经理。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
马科斯没料到,被折磨到脱相的杜特尔特,在海牙打了场翻身仗

马科斯没料到,被折磨到脱相的杜特尔特,在海牙打了场翻身仗

湘评中外
2026-09-17 17:06:40
国家统计局:8月全国城镇不包含在校生16-24岁劳动力失业率18.9%

国家统计局:8月全国城镇不包含在校生16-24岁劳动力失业率18.9%

澎湃新闻
2026-09-17 19:56:27
韩媒:一旦开战,将对北京发起致命打击,大连、青岛都在列!

韩媒:一旦开战,将对北京发起致命打击,大连、青岛都在列!

兔兔侃娱乐
2026-09-16 20:43:14
“中国人不来也没关系”?打脸了!

“中国人不来也没关系”?打脸了!

环球时报国际
2026-09-17 17:15:36
零容忍!中国篮协官宣重罚北京男篮,王骁辉被停赛1年,上海仍无消息

零容忍!中国篮协官宣重罚北京男篮,王骁辉被停赛1年,上海仍无消息

多特体育说
2026-09-17 23:11:29
平陆运河开通了,当年的很多功臣却已经不在了

平陆运河开通了,当年的很多功臣却已经不在了

超级学爸蛋总
2026-09-17 19:14:30
首批上手反馈令人失望?iPhone Duo接连翻车,轻掰机身外屏出现闪屏

首批上手反馈令人失望?iPhone Duo接连翻车,轻掰机身外屏出现闪屏

泡泡网
2026-09-17 10:11:45
“敲骨吸髓”式查税?中小企业最怕的不是补税,而是突然翻旧账

“敲骨吸髓”式查税?中小企业最怕的不是补税,而是突然翻旧账

风向观察
2026-09-17 19:21:43
炸裂!女网红和男子开房,因动作太猛导致女网红腰部骨折,告上法庭索赔50万

炸裂!女网红和男子开房,因动作太猛导致女网红腰部骨折,告上法庭索赔50万

小徐讲八卦
2026-09-17 09:49:48
佟丽娅接受采访,首次公开此前婚姻细节:没想过拍《北爱》会和陈思诚好,他没有打过我,当年没立即离婚不是因为“懦弱”

佟丽娅接受采访,首次公开此前婚姻细节:没想过拍《北爱》会和陈思诚好,他没有打过我,当年没立即离婚不是因为“懦弱”

极目新闻
2026-09-17 21:33:02
网传未来14年平均每天6万人退休,网友担心社保能否负担得起钱?

网传未来14年平均每天6万人退休,网友担心社保能否负担得起钱?

慧翔百科
2026-09-17 16:51:06
8月份的宏观经济数据,很多问题已经很严重了

8月份的宏观经济数据,很多问题已经很严重了

道格财经观
2026-09-17 14:08:44
9月17日,人社部、财政部关于2026年上调退休人员基本养老金通知公布之前,看病就医率先迎来了3个好消息

9月17日,人社部、财政部关于2026年上调退休人员基本养老金通知公布之前,看病就医率先迎来了3个好消息

白昼说故事
2026-09-17 09:40:26
任正非失联传闻刷屏,看懂谣言的底层套路

任正非失联传闻刷屏,看懂谣言的底层套路

小星球探索
2026-09-17 14:39:03
中国免签捅马蜂窝了?韩国近6万人突然联署,要求叫停中国团客免签,发生了什么?

中国免签捅马蜂窝了?韩国近6万人突然联署,要求叫停中国团客免签,发生了什么?

青青子衿
2026-09-16 16:58:57
事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

人生录
2026-09-11 00:05:21
李小璐疑似新男友曝光!被拍到与嘻哈歌手赵涛逛公园,4年3次同框引猜测

李小璐疑似新男友曝光!被拍到与嘻哈歌手赵涛逛公园,4年3次同框引猜测

露珠聊影视
2026-09-17 16:25:38
女儿踩坏床头柜怕被骂悄悄扔掉,两天后母亲想起:有370多克黄金铂金和190余万银行存单全在床头柜里;安徽当地警方连夜追回,分毫未少

女儿踩坏床头柜怕被骂悄悄扔掉,两天后母亲想起:有370多克黄金铂金和190余万银行存单全在床头柜里;安徽当地警方连夜追回,分毫未少

三湘都市报
2026-09-17 21:32:50
陈冠希现开机仪式,长发齐肩胡子拉碴,跟大肚垮脸的黄秋生差别大

陈冠希现开机仪式,长发齐肩胡子拉碴,跟大肚垮脸的黄秋生差别大

娱说瑜悦
2026-09-17 19:06:50
“你想毁掉自己的职业生涯吗?”

“你想毁掉自己的职业生涯吗?”

中国新闻周刊
2026-09-17 16:50:58
2026-09-18 03:24:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4805694文章数 9630关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带 脱黑丝袜洗澡

头条要闻

永和豆浆视频被指擦边:女子穿蕾丝吊带 脱黑丝袜洗澡

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

教育
时尚
数码
家居
手机

教育要闻

统一校服要来了?成都这个区,即将“抄作业”!

潮流之向,自有回响——浪潮音乐大赏特别企划

数码要闻

苹果AirPods 5耳机今日正式开售,999元起标配主动降噪

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

鸿蒙7花粉Beta版有惊喜,华为Mate 60系列手机升级后新增支持眼动翻页功能

无障碍浏览 进入关怀版