网易首页 > 网易号 > 正文 申请入驻

AI大模型周榜:Kimi K3首次杀入综合榜Top 10,登顶前端开发榜

0
分享至

IT之家 7 月 20 日消息,Arena(arena.ai)平台发布了 2026-29 期大模型排行榜,统计周期为 2026 年 7 月 13 日 ~2026 年 7 月 19 日。

本周榜单迎来大规模新模型集中入榜,其中最受关注的是国产模型 kimi-k3 的突出表现:它不仅首次杀入综合榜 Top 10,更直接登顶前端开发榜榜首,在细分能力上实现了对多数海外头部模型的反超。

整体来看,多款国产模型在多个榜单的前列位置站稳脚跟,梯队完整度进一步提升。

综合榜

综合榜头部位置由 Claude、Meta、谷歌、OpenAI 等厂商的新模型主导,第一名依然由 claude-fable-5 占据,ELO 为 1507 分。Anthropic 旗下多款思考版本模型集中入驻 Top 5,彼此之间分差全部在 15 分以内,在误差范围内属于并列第一梯队。

本周最大的亮点是国产模型 kimi-k3 凭借 1486 分的 ELO 排名来到第 9 位,首次跻身综合榜 Top 10,和第 8 名的 gemini-3-pro、第 10 名的 gpt-5.6-sol-xhigh 分数完全一致,属于第一梯队的边缘位置。

国产模型在综合榜分布于中上游位置,梯队表现稳定:

  • 月之暗面 kimi-k3 排名第 9 位,ELO 1486 分,较上周上升 1 位,首次进入 Top 10;
  • 阿里 qwen3.7-max-preview 排名第 18 位,ELO 1475 分,排名持平;
  • 智谱 glm-5.1 排名第 27 位,ELO 1471 分,较上周下降 2 位;
  • 智谱 glm-5.2 (max) 排名第 30 位,ELO 1468 分,排名持平。
排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文1 — claude-fable-5Anthropic1507 ±78819$10 / $501M2 — claude-opus-4-6-thinkingAnthropic1504 ±461003$5 / $251M3 — claude-opus-4-7-thinkingAnthropic1503 ±448292$5 / $251M4 — claude-opus-4-6Anthropic1498 ±464747$5 / $251M5 — claude-opus-4-7Anthropic1494 ±449467$5 / $251M6 — muse-spark-1.1Meta1493 ±85729$1.25 / $4.25N/A7 — muse-sparkMeta1487 ±613572N/AN/A8 ↑1 gemini-3-pro谷歌1486 ±441290$2 / $121.05M9 ↑1 kimi-k3月之暗面1486 ±113024$3 / $151.05M10 ↓2 gpt-5.6-sol-xhighOpenAI1486 ±94095N/AN/A— 以下为 Top 10 外的国产模型 —18 ↓1 qwen3.7-max-preview阿里1475 ±103717$1.48 / $4.431M27 ↓2 glm-5.1智谱1471 ±528606$1.4 / $4.4202.8K30 — glm-5.2 (max)智谱1468 ±615642$1.4 / $4.41M代码榜

代码榜榜首位置发生变动,claude-opus-4-7-thinking 从第 2 位升至第 1 位,ELO 分数为 1553 分,把此前排名第一的 claude-fable-5 挤到第 2 位,后者分数降至 1551 分。两者仅有 2 分的差距,完全在置信区间范围内,属于并列第一梯队。Anthropic 的多款思考模型几乎包揽了榜单前 7 的所有位置,整体统治力依然强劲。

而国产模型 kimi-k3 首次进入代码榜 Top 10,排名第 10 位,ELO 1529 分,和第 9 名的模型分数仅差 1 分,表现相当接近第一梯队。

国产模型在代码榜覆盖多段位梯队,表现均衡:

  • 月之暗面 kimi-k3 排名第 10 位,ELO 1529 分,首次进入代码榜 Top 10;
  • 阿里 qwen3.7-max-preview 排名第 12 位,ELO 1527 分;
  • 智谱 glm-5.1 排名第 17 位,ELO 1521 分,较上周上升 1 位;
  • 小米 mimo-v2.5-pro 排名第 24 位,ELO 1518 分,较上周下降 1 位;
  • 月之暗面 kimi-k2.6 排名第 26 位,ELO 1515 分,较上周下降 1 位;
  • 百度 ernie-5.1 排名第 27 位,ELO 1514 分,较上周下降 1 位;
排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文1 ↑1 claude-opus-4-7-thinkingAnthropic1553 ±713772$5 / $251M2 ↓1 claude-fable-5Anthropic1551 ±122459$10 / $501M3 — claude-opus-4-6-thinkingAnthropic1550 ±615751$5 / $251M4 ↑1 claude-opus-4-6Anthropic1549 ±617906$5 / $251M5 ↓1 claude-opus-4-7Anthropic1548 ±714088$5 / $251M6 — claude-opus-4-8-thinkingAnthropic1535 ±88002$5 / $251M7 — claude-opus-4-8Anthropic1533 ±88172$5 / $251M8 — muse-spark-1.1Meta1532 ±151718$1.25 / $4.25N/A9 — claude-opus-4-5-20251101-thinking-32kAnthropic1530 ±77614$5 / $25200K10 kimi-k3月之暗面1529 ±22798$3 / $151.05M— 以下为 Top 10 外的国产模型 —12 ↑1 qwen3.7-max-preview阿里1527 ±181123$1.48 / $4.431M17 ↑1 glm-5.1智谱1521 ±88056$1.4 / $4.4202.8K24 ↓1 mimo-v2.5-pro小米1518 ±710969$0.44 / $0.871.05M26 ↓1 kimi-k2.6月之暗面1515 ±710359$0.95 / $4262.1K27 ↓1 ernie-5.1百度1514 ±710403N/AN/A前端开发榜

前端开发榜呈现出前所未有的格局,国产模型 kimi-k3 直接以 1679 分的高 ELO 稳居第一名,大幅领先第二名 claude-fable-5 的 1631 分,分差达到 48 分,优势十分明显。

第四名同样由国产模型 glm-5.2 (max) 拿下,ELO 1587 分,超过了多款 Claude、OpenAI 的旗舰模型。这意味着国产大模型在前端开发这一细分场景的能力已经走在了全球最前列。

国产模型在前端开发榜占据头部和中上游多个位置,覆盖完整梯队:

  • 月之暗面 kimi-k3 排名第 1 位,ELO 1679 分,排名稳居第一;
  • 智谱 glm-5.2 (max) 排名第 4 位,ELO 1587 分,排名保持在前五;
  • 字节跳动 seed-2.1-pro-preview 排名第 14 位,ELO 1534 分,首次入驻榜单前半区;
  • 智谱 glm-5.1 排名第 15 位,ELO 1526 分,表现稳定;
  • 阿里 qwen3.7-max-20260517 排名第 17 位,ELO 1516 分;
  • 月之暗面 kimi-k2.6 排名第 18 位,ELO 1515 分;
排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文1 — kimi-k3月之暗面1679 ±171757$3 / $151.05M2 — claude-fable-5Anthropic1631 ±132505$10 / $501M3 — gpt-5.6-sol-xhigh (codex-harness)OpenAI1618 ±132542$5 / $301.05M4 — glm-5.2 (max)智谱1587 ±104722$1.4 / $4.41M5 — claude-opus-4-8-thinkingAnthropic1562 ±97309$5 / $251M6 — grok-4.5SpaceXAI1558 ±132214$2 / $6500K7 — claude-opus-4-7-thinkingAnthropic1558 ±710534$5 / $251M8 — claude-opus-4-7Anthropic1555 ±79976$5 / $251M9 — claude-opus-4-6-thinkingAnthropic1542 ±612919$5 / $251M10 — claude-sonnet-5-highAnthropic1542 ±122959$2 / $101M— 以下为 Top 10 外的国产模型 —14 — seed-2.1-pro-preview字节跳动1534 ±103909N/AN/A15 — glm-5.1智谱1526 ±95870$1.4 / $4.4202.8K17 — qwen3.7-max-20260517阿里1516 ±86455$1.48 / $4.431M18 — kimi-k2.6月之暗面1515 ±79321$0.95 / $4262.1K智能体榜

智能体榜本周全部是全新入榜模型,排名第一的是 Claude Fable 5 (High),净提升度 13.94%,同时拥有 30.65% 的最高好评 / 差评比,工具幻觉率仅 1.33% 属于较低水平。第二名 GPT 5.6 Sol (xHigh) 的可控性数值最高,达到 17.26%。头部三款模型的净提升度差距都明显大于各自的置信区间,属于表现分层的清晰格局。

国产模型 GLM 5.2 (Max) 杀入榜单 Top 10 位列第 9,净提升度为 6.24%,它的 Bash 恢复速度仅 4.45,远好于头部平均水平,命令出错后能快速恢复,表现突出。

国产模型在智能体榜覆盖靠前和中间多个位置,工具相关能力表现亮眼:

  • 智谱 glm-5.2 (max) 排名第 9 位,净提升度 6.24%,任务确认成功率 8.72%;
  • 智谱 glm-5.1 排名第 16 位,净提升度 1.19%;
  • 阿里 qwen3.7 Plus 排名第 18 位,净提升度 0.61%,工具幻觉率仅 0.19%;
  • 月之暗面 kimi-k2.7-code 排名第 20 位,净提升度 0.76%;
  • 阿里 qwen3.7 Max 排名第 21 位,净提升度 0.81%;
  • 深度求索 deepseek-v4-pro 排名第 22 位,净提升度 1.11%;
排名模型厂商净提升度 (±CI)任务确认成功率好评 / 差评比可控性会话数1 — Claude Fable 5 (High)Anthropic13.94% ±1.56%17.27%30.65%12.07%160592 — GPT 5.6 Sol (xHigh)OpenAI10.94% ±3.76%10.93%17.64%17.26%78813 — Claude Opus 4.8 (Thinking)Anthropic9.28% ±1.35%7.82%17.96%10.15%333924 — GPT 5.5 (xHigh)OpenAI8.26% ±0.87%6.88%12.61%6.7%362895 — Claude Sonnet 5 (High)Anthropic8.0% ±1.71%10.33%13.9%4.92%236406 — Claude Opus 4.7 (Thinking)Anthropic7.73% ±1.22%5.22%11.36%9.17%343577 — Claude Opus 4.7Anthropic7.63% ±1.22%5.28%13.38%7.56%349508 — GPT 5.5 (High)OpenAI7.16% ±0.75%6.42%7.61%8.72%614559 — GLM 5.2 (Max)智谱6.24% ±1.1%8.72%12.59%4.1%3199310 — GPT 5.5OpenAI6.05% ±0.72%4.33%5.53%7.99%62335— 以下为 Top 10 外的国产模型 —16 — GLM 5.1智谱1.19% ±0.82%0.78%0.53%0.62%5136218 — Qwen3.7 Plus阿里0.61% ±1.38%1.1%4.04%2.73%1004820 — Kimi K2.7 Code月之暗面0.76% ±2.01%4.51%1.38%10.78%7468AI 生图 & AI 视频榜

AI 生图榜本周整体格局稳定,OpenAI 的 gpt-image-2 (medium) 依然以 1385 分的 ELO 稳居第一,字节跳动 seedream-5.0-pro 作为最高排名的国产模型位列第 11 位,ELO 1231 分,紧随多款海外头部生图模型之后。

而在 AI 视频榜,谷歌 gemini-omni-flash 位列榜首;字节跳动的 dreamina-seedance-2.0-720p 稳居第二名,ELO 分数 1482 分,表现远超多数海外视频生成模型;同时阿里 happyhorse-1.0 也拿下第 4 位,国产力量在 AI 视频生成第一梯队已经占据了重要席位。

本周 Arena 榜单的最大亮点就是国产模型的多点突破,尤其是 kimi-k3 首次冲进综合榜 Top 10,并且直接登顶前端开发榜,证明国产大模型不仅在通用能力上追平第一梯队,在特定工程类任务场景已经形成了领先优势。同时字节、阿里、智谱等厂商的多款模型也在代码、生图、视频、智能体多个榜单的前半区站稳脚跟。

下周预计将有更多用户评测数据进一步积累,部分新入榜模型的排名和分数还可能出现小幅变动,值得关注后续国产模型能否在更多细分榜单拿下榜首位置。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

坠入二次元的海洋
2026-09-11 00:35:48
号称水浒“小吕布”,曾击杀一位五虎将,最终遭梁山六将围攻战死!

号称水浒“小吕布”,曾击杀一位五虎将,最终遭梁山六将围攻战死!

历史龙元阁
2026-10-04 12:20:16
中际旭创的眼光还是太毒了

中际旭创的眼光还是太毒了

财报时间
2026-10-04 08:35:58
马斯克:成为强者的第一步——杀死内心所有的恐惧。你只活70年,归宿都是寂灭,怕什么

马斯克:成为强者的第一步——杀死内心所有的恐惧。你只活70年,归宿都是寂灭,怕什么

杏花烟雨江南的碧园
2026-08-30 16:15:03
韩国射箭神话破灭!女子反曲弓名古屋惨案,印度宣告崛起

韩国射箭神话破灭!女子反曲弓名古屋惨案,印度宣告崛起

体育妞世界
2026-10-04 00:35:04
半岛局势突然“失控”,韩国一改温和态度,强烈要求朝鲜公开道歉

半岛局势突然“失控”,韩国一改温和态度,强烈要求朝鲜公开道歉

观锐器
2026-10-01 16:04:18
决胜分后双拳指天!16岁孙心然创7纪录比肩小米辣 美媒:太厉害了

决胜分后双拳指天!16岁孙心然创7纪录比肩小米辣 美媒:太厉害了

颜小白的篮球梦
2026-10-03 20:41:17
笑死!北京会惩罚每一个过度规划的游客,网友:兵马俑都没你能走

笑死!北京会惩罚每一个过度规划的游客,网友:兵马俑都没你能走

夜深爱杂谈
2026-10-01 20:22:18
推平黄土高原,造五亿亩良田,斥万亿巨资造良田是否可行?

推平黄土高原,造五亿亩良田,斥万亿巨资造良田是否可行?

乌克兰小静
2026-10-04 07:43:43
21岁浙江姑娘亚运会拿5金2银,被韩国媒体追着问是不是混血

21岁浙江姑娘亚运会拿5金2银,被韩国媒体追着问是不是混血

有态度网友19ILam
2026-10-03 10:42:36
已满!已满!堵成深红!尽量不要开车去

已满!已满!堵成深红!尽量不要开车去

江南晚报
2026-10-04 13:25:10
温瑞博回应外界舆论:真心喜欢我们的人不会去攻击我们的球队

温瑞博回应外界舆论:真心喜欢我们的人不会去攻击我们的球队

懂球帝
2026-10-04 14:49:17
夫妻裸睡是什么体验?不用觉得难为情,坚持下来能收获5个好处

夫妻裸睡是什么体验?不用觉得难为情,坚持下来能收获5个好处

观星赏月
2026-10-04 16:03:02
张本美和也没料到,哥哥被曝丑闻才几天,自己又迎来“心腹大患”

张本美和也没料到,哥哥被曝丑闻才几天,自己又迎来“心腹大患”

晓銊就是我
2026-10-04 05:59:27
2013年1月27日夜晚,在北京西单,29岁的杨雪鸥驾驶男友新买的牧马人,停车三小时

2013年1月27日夜晚,在北京西单,29岁的杨雪鸥驾驶男友新买的牧马人,停车三小时

起喜电影
2026-10-04 10:57:07
震惊!有大学生提议室友上交全部生活费统一保管遭拒,发帖人不解之余,室友视作“舍敌”

震惊!有大学生提议室友上交全部生活费统一保管遭拒,发帖人不解之余,室友视作“舍敌”

火山詩话
2026-10-02 08:52:28
前英格兰国脚确认,性侵自己的是舞蹈教练,曾被打晕,已入狱服刑

前英格兰国脚确认,性侵自己的是舞蹈教练,曾被打晕,已入狱服刑

小金体坛大视野
2026-10-04 10:12:17
可乐再次被关注!医生发现:脂肪肝者喝可乐,不用多久或有6变化

可乐再次被关注!医生发现:脂肪肝者喝可乐,不用多久或有6变化

路医生健康科普
2026-08-20 07:30:10
卢宇光称俄军失守乌东重镇利曼!乌克兰持续向东挺进

卢宇光称俄军失守乌东重镇利曼!乌克兰持续向东挺进

项鹏飞
2026-10-03 20:11:28
社保挂靠:钱全部自己交,国家没少收钱,凭什么还违法?

社保挂靠:钱全部自己交,国家没少收钱,凭什么还违法?

你在偷看谁
2026-10-03 18:28:09
2026-10-04 17:27:00
IT之家
IT之家
爱科技,爱这里 - 前沿科技人气平台
370880文章数 607587关注度
往期回顾 全部

科技要闻

苹果确认:iPhone 18 Pro Max有问题

头条要闻

中国运动员亚运夺银国庆回家掰苞米 经纪人回应

头条要闻

中国运动员亚运夺银国庆回家掰苞米 经纪人回应

体育要闻

“小将”吴曦,中国的莫德里奇

娱乐要闻

杨议没料到,郭德纲如今仍是一呼百应

财经要闻

OpenAI前安全部门员工:公司文化已崩坏

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

家居
亲子
旅游
游戏
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

2岁娃连吃8个月儿童装银鳕鱼汞中毒,商家称儿童装并非儿童食品

旅游要闻

贵州晴隆再回应二十四道拐景区收费:观景台、展览馆将免票

《最终幻想7:启示》导演称尽力争取完整光盘版

军事要闻

驻冲绳美军士兵抢劫杀人 日本向美国提出抗议

无障碍浏览 进入关怀版