网易首页 > 网易号 > 正文 申请入驻

AI大模型周榜:国产多模型扎堆入榜前端开发榜

0
分享至

IT之家 9 月 7 日消息,Arena(arena.ai)平台本周发布 2026 年第 36 周(8 月 31 日 ~9 月 6 日)AI 大模型盲测排名,本期迎来多个重量级新模型入榜,其中多款国产模型在细分榜单实现亮眼突破。

  • 前端开发榜中,阿里 qwen3.8-max-0902 首次入榜即位列第 4,阿里 qwen3.8-flash-next、腾讯 hy4-preview、智谱 glm-5.3-flash 也同步首次入榜并杀入前 15;
  • AI 视频榜中,阿里 wan3.0 首次入榜直接冲进前三,展现国产生成视频模型的最新竞争力。

整体来看,头部格局仍以海外模型为主,但国产模型在细分领域的进步速度值得关注。

IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。

综合榜

本期综合榜头部排名整体稳定,claude-fable-5 以 1507 分蝉联榜首,claude-opus-4-6-high 以 1505 分紧随其后,两者分差仅 2 分,在误差范围内视为接近。

本周有两款新模型首次入榜,Anthropic claude-fable-5.1-max 直接冲入前三,ELO 得分 1504 分,位列第 3;谷歌 gemini-3.8-flash-high 位列第 8,ELO 得分 1494 分,目前仍为 preliminary 阶段。

头部前 10 名分数均在 1492 分以上,分差均小于 30 分,整体竞争非常胶着。

国产模型整体处于中上游位置,梯队相对稳定:

  • 月之暗面 kimi-k3-max 排名最高,位列第 12 名,ELO 1489 分,排名持平;
  • 智谱 glm-5.3-max 位列第 20 名,ELO 1482 分,较上周下降 5 位;
  • 阿里 qwen3.8-max 位列第 22 名,ELO 1480 分,排名下降 2 位;
排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出上下文1-claude-fable-5Anthropic1507 ±527189$10 / $501M2-claude-opus-4-6-highAnthropic1505 ±472099$5 / $251M3新上榜claude-fable-5.1-maxAnthropic1504 ±112906$10 / $501M4↓ 1claude-opus-4-7-highAnthropic1502 ±460103$5 / $251M5↓ 1muse-spark-1.2 (xHigh)Meta1499 ±103240$1.25 / $4.25N/A6↓ 1claude-opus-4-6Anthropic1498 ±376015$5 / $251M7↓ 1claude-opus-4-7Anthropic1494 ±461238$5 / $251M8新上榜gemini-3.8-flash-highGoogle1494 ±95125$0.75 / $3.751.05M9↓ 2claude-opus-5-highAnthropic1493 ±535174$5 / $251M10↓ 2muse-spark-1.1Meta1492 ±524064$1.25 / $4.25N/A— 以下为 Top 10 外的国产模型 —12↓ 2kimi-k3-maxMoonshot1489 ±518090N/AN/A20↓ 5glm-5.3-maxZ.ai1482 ±77668$1.4 / $4.41.05M22↓ 2qwen3.8-maxAlibaba1480 ±613346$2 / $61M代码榜

代码榜头部格局同样稳定,claude-opus-4-7-high 和 claude-opus-4-6-high 同以 1552 分并列前两位,claude-fable-5 以 1551 分紧随其后,前三名均为 Anthropic 模型。

本周谷歌 gemini-3.8-flash-high 首次入榜即位列第 7,ELO 1537 分;OpenAI gpt-5.5-high 也首次入榜,位列第 28,ELO 1520 分。国产模型 glm-5.3-flash 排名上升 2 位,来到第 9,表现亮眼。

国产模型在代码榜已有多款进入前 30,具体排名如下:

  • 月之暗面 kimi-k3-max 位列第 6 名,ELO 1542 分,排名持平;
  • 智谱 glm-5.3-flash 位列第 9 名,ELO 1534 分,较上周上升 2 位;
  • 智谱 glm-5.3-max 位列第 16 名,ELO 1528 分,较上周下降 3 位;
  • 阿里 qwen3.8-max 位列第 30 名,ELO 1520 分,较上周下降 4 位;
排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出上下文1-claude-opus-4-7-highAnthropic1552 ±617176$5 / $251M2-claude-opus-4-6-highAnthropic1552 ±618800$5 / $251M3-claude-fable-5Anthropic1551 ±87293$10 / $501M4-claude-opus-4-7Anthropic1547 ±617342$5 / $251M5-claude-opus-4-6Anthropic1546 ±521198$5 / $251M6-kimi-k3-maxMoonshot1542 ±94719N/AN/A7新上榜gemini-3.8-flash-highGoogle1537 ±161456$0.75 / $3.751.05M8↑ 1claude-opus-4-8-highAnthropic1534 ±613439$5 / $251M9↑ 2glm-5.3-flashZ.ai1534 ±171274$0.15 / $0.51.05M10↓ 3muse-spark-1.2 (xHigh)Meta1533 ±20935$1.25 / $4.25N/A— 以下为 Top 10 外的国产模型 —16↓ 3glm-5.3-maxZ.ai1528 ±142008$1.4 / $4.41.05M19↓ 1qwen3.7-max-previewAlibaba1525 ±181118$1.48 / $4.431M26↑ 1mimo-v2.5-proXiaomi1520 ±615813$0.44 / $0.871.05M30↓ 4qwen3.8-maxAlibaba1520 ±103867$2 / $61M前端开发榜

前端开发榜本周迎来密集新模型入榜,OpenAI gpt-6-astra-max 首次登榜即拿下榜首,ELO 1797 分;Anthropic claude-fable-5.1-max 首次入榜位列第二,ELO 1762 分。

国产模型此次扎堆入榜表现突出,阿里 qwen3.8-max-0902 首次入榜即冲到第 4,ELO 1686 分,仅次于三款海外头部模型;阿里 qwen3.8-flash-next、腾讯 hy4-preview、智谱 glm-5.3-flash 也均首次入榜并杀入前 15,分别位列第 9、第 12、第 15。

国产模型在前端开发榜已有多款进入前 20:

  • 阿里 qwen3.8-max-0902 排名最高,位列第 4 名,ELO 1686 分,首次入榜;
  • 月之暗面 kimi-k3-max 位列第 5 名,ELO 1674 分,排名下降 3 位;
  • 阿里 qwen3.8-max 位列第 6 名,ELO 1670 分,排名下降 3 位;
  • 阿里 qwen3.8-flash-next 位列第 9 名,ELO 1626 分,首次入榜;
  • 腾讯 hy4-preview 位列第 12 名,ELO 1621 分,首次入榜。
排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出上下文1新上榜gpt-6-astra-maxOpenAI1797 ±241199$10 / $501.05M2新上榜claude-fable-5.1-maxAnthropic1762 ±162275$10 / $501M3↓ 2claude-opus-5-maxAnthropic1688 ±810904$5 / $251M4新上榜qwen3.8-max-0902Alibaba1686 ±161868$2 / $6N/A5↓ 3kimi-k3-maxMoonshot1674 ±114546$3 / $151.05M6↓ 3qwen3.8-maxAlibaba1670 ±123223$2 / $61M7↓ 3claude-opus-5-highAnthropic1661 ±710928$5 / $251M8↓ 2claude-fable-5Anthropic1629 ±89356$10 / $501M9新上榜qwen3.8-flash-nextAlibaba1626 ±142158$0.16 / $0.471M10↓ 5grok-4.6-highSpaceXAI1625 ±113487$2 / $6500K— 以下为 Top 10 外的国产模型 —12新上榜hy4-previewTencent1621 ±161661$0.83 / $2.51.05M14↓ 6glm-5.3-maxZ.ai1609 ±122930$1.4 / $4.41.05M15新上榜glm-5.3-flashZ.ai1605 ±151961$0.15 / $0.51.05M16↓ 7qwen3.8-27bAlibaba1594 ±113543$0.4 / $3N/A18↓ 7glm-5.2-maxZ.ai1587 ±79836$1.4 / $4.41M19↓ 7deepseek-v4-pro-high-20260813DeepSeek1582 ±113518$1.32 / $3.96N/A20↓ 7deepseek-v4-flash-highDeepSeek1580 ±104177$0.44 / $1.321.05M智能体榜

智能体榜本周迎来新模型 claude-fable-5.1-max 首次登榜,直接以 15.87% 的净提升度登顶榜首,原榜首 Claude Opus 5 (High) 以 12.68% 降至第二。

在信号指标方面,claude-opus-4.8 (High) 工具幻觉率仅 0.24%,为头部最低;kimi-k3-max 任务确认成功率达到 16.58%,在国产模型中领先。

国产模型在智能体榜已有多款进入前 30,其中多款新模型本周首次入榜:

  • 月之暗面 kimi-k3-max 排名最高,位列第 7 名,净提升度 7.96%,任务确认成功率 16.58%,排名下降 1 位;
  • 腾讯 hy4-preview 位列第 10 名,净提升度 6.92%,任务确认成功率 13.56%,首次入榜;
  • 智谱 glm-5.2 (max) 位列第 12 名,净提升度 6.03%,较上周上升 4 位;
  • 阿里 qwen3.8-max 位列第 16 名,净提升度 5.51%,较上周下降 5 位;
排名较上周模型厂商净提升度 (±CI)任务确认成功率好评 / 差评比可控性1新上榜Claude Fable 5.1 (Max)Anthropic15.87% ±2.84%22.45% ±3.71%42.45% ±10.94%0.58% ±6.77%2↓ 1Claude Opus 5 (High)Anthropic12.68% ±1.73%13.3% ±3.69%18.27% ±6.49%16.09% ±3.24%3↓ 1Claude Opus 5 (Max)Anthropic11.67% ±1.96%14.89% ±3.95%17.3% ±7.1%9.7% ±3.85%4↓ 1Claude Fable 5 (High)Anthropic10.23% ±1.46%7.37% ±3.17%19.36% ±5.29%11.89% ±2.68%5↓ 1GPT 5.6 Sol (xHigh)OpenAI9.31% ±1.49%6.68% ±3.13%22.07% ±5.5%8.88% ±2.84%6↓ 1Claude Opus 4.8 (High)Anthropic9.17% ±1.48%5.27% ±3.07%18.04% ±5.19%12.59% ±2.73%7↓ 1Kimi K3 (Max)Moonshot7.96% ±0.68%16.58% ±1.4%14.03% ±2.36%1.24% ±1.35%8-Claude Sonnet 5 (High)Anthropic7.41% ±1.95%2.8% ±4.13%11.19% ±6.78%11.52% ±4.13%9↓ 2GPT 5.5 (xHigh)OpenAI7.21% ±1.08%2.07% ±2.42%11.41% ±3.77%8.54% ±2.01%10新上榜Hy4 previewTencent6.92% ±1.51%13.56% ±2.96%10.26% ±5.61%0.1% ±3.21%— 以下为 Top 10 外的国产模型 —12↑ 4GLM 5.2 (Max)Z.ai6.03% ±0.76%8.63% ±1.64%11.73% ±2.67%4.48% ±1.38%16↓ 5Qwen3.8 MaxAlibaba5.51% ±1.09%10.37% ±2.35%6.58% ±3.8%4.15% ±2.19%18↓ 6DeepSeek V4 Pro (High) (0813)DeepSeek5.43% ±0.9%11.75% ±1.91%5.24% ±3.13%0.67% ±1.95%22↓ 2GLM 5.3 (Max)Z.ai3.8% ±0.71%12.1% ±1.52%5.75% ±2.41%0.63% ±1.37%23新上榜GLM 5.3 FlashZ.ai3.67% ±1.03%14.14% ±2.16%5.45% ±3.49%0.23% ±2.12%24↓ 2Deepseek V4 Flash (High)
(20260731)DeepSeek3.29% ±0.8%8.46% ±1.76%3.9% ±2.76%0.02% ±1.6%27新上榜Qwen3.8 Flash NextAlibaba2.61% ±1.21%12.46% ±2.49%0.24% ±4.15%1.18% ±2.74%30↓ 3Qwen 3.8 27BAlibaba1.03% ±0.99%6.98% ±2.26%0.78% ±3.28%0.39% ±2.02%AI 生图榜

AI 生图榜头部格局稳定,gpt-image-2 (medium) 以 1382 分蝉联榜首;微软 mai-image-2.6 首次入榜即拿到第二名,ELO 1332 分。

国产模型 seedream-5.0-pro 稳定保持第 8,qwen-image-3.0-pro 位列第 9,hunyuan-image-3.0 位列第 29,整体排名变化不大。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出上下文1-gpt-image-2 (medium)OpenAI1382 ±477830$8 / $30N/A2新上榜mai-image-2.6Microsoft AI1332 ±710086N/AN/A3-grok-imagine-image-2.0 (low)SpaceXAI1315 ±122682N/AN/A4-reve-2.1Reve1301 ±87576N/AN/A5-muse-imageMeta1279 ±624856N/AN/A6-reve-2.0Reve1270 ±614636N/AN/A7-gemini-3.1-flash-image
(nano-banana-2) [web-search]Google1261 ±540649$0.5 / $3131.1K8-seedream-5.0-proBytedance1258 ±459484N/AN/A9-qwen-image-3.0-proAlibaba1254 ±710923N/AN/A10-mai-image-2.5Microsoft AI1254 ±457295N/AN/A— 以下为 Top 10 外的国产模型 —16-qwen-image-2.0-pro-2026-06-22Alibaba1191 ±612016N/AN/A29-hunyuan-image-3.0Tencent1151 ±3173129N/AN/AAI 视频榜

AI 视频榜本周最大亮点是阿里 wan3.0 首次入榜即冲进前三,ELO 得分 1494 分,仅次于谷歌 gemini-omni-1.1-flash( 1515 分)和 gemini-omni-flash( 1511 分),与第四名 flux-3-video( 1494 分)同分,在误差范围内视为并列。

国产 dreamina-seedance-2.5-720p 排名上升一位,来到第 6;minimax-h3 位列第 8,整体国产模型占据多个中上游位置。

排名较上周模型厂商分数 (±CI)票数价格 ($/M)
输入 / 输出上下文1-gemini-omni-1.1-flashGoogle1515 ±151777$1.5 / $9131.1K2-gemini-omni-flashGoogle1511 ±1021934N/AN/A3新上榜wan3.0Alibaba1494 ±191167N/AN/A4↓ 1flux-3-videoBlack Forest Labs1494 ±171290N/AN/A5新上榜grok-imagine-video-1.5-agentSpaceXAI1491 ±191195N/AN/A6↓ 1dreamina-seedance-2.5-720pBytedance1482 ±124066N/AN/A7↓ 3dreamina-seedance-2.0-720pBytedance1479 ±852864N/AN/A8↓ 2minimax-h3MiniMax1462 ±107648N/AN/A9↓ 2muse-videoMeta1456 ±152178N/AN/A10↓ 2happyhorse-1.0Alibaba-ATH1427 ±1322116N/AN/A— 以下为 Top 10 外的国产模型 —19↓ 4wan2.7-t2vAlibaba1341 ±823025N/AN/A21↓ 2wan2.6-t2vAlibaba1328 ±849348N/AN/A22↓ 2seedance-v1.5-proBytedance1256 ±775891N/AN/A25↓ 2wan2.5-t2v-previewAlibaba1246 ±932461N/AN/A

本期 Arena 周榜的最大看点是大量新模型集中发布并迅速入榜测试,其中国产模型在前端开发、AI 生成视频等细分领域实现了突破性排名,多款新模型首次入榜就冲进前十甚至前三,展现出快速迭代的竞争力。

头部综合榜仍由海外厂商模型占据,但国产模型与头部的分差正在持续缩小。

下周随着更多新模型完成投票积累,排名格局有望进一步变化,值得持续关注。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
《伟大的长征》即将开播!首次饰演毛泽东,于和伟减重15斤

《伟大的长征》即将开播!首次饰演毛泽东,于和伟减重15斤

澎湃新闻
2026-10-01 13:34:06
离谱血亏!利物浦 3500 万甩卖天才!阿森纳 6500 万豪砸直接被拒

离谱血亏!利物浦 3500 万甩卖天才!阿森纳 6500 万豪砸直接被拒

澜归序
2026-10-01 08:42:36
孙俪邓超现身妈妈生宴,孙母脸很肿打扮时髦,美甲鲜红戴大金镯子

孙俪邓超现身妈妈生宴,孙母脸很肿打扮时髦,美甲鲜红戴大金镯子

嫹笔牂牂
2026-10-01 07:08:38
又一架图-95坠毁,俄已折损大半

又一架图-95坠毁,俄已折损大半

书生论剑
2026-09-30 07:33:21
一场69岁同学聚会,我彻底看懂:月退休金8千以上的,是什么档次

一场69岁同学聚会,我彻底看懂:月退休金8千以上的,是什么档次

刘哥谈体育
2026-10-01 20:07:54
拉夫罗夫主动让出位子,功成身退时机刚好,普京早已安排别人顶上

拉夫罗夫主动让出位子,功成身退时机刚好,普京早已安排别人顶上

深析古今
2026-10-01 05:24:44
民政厅正式通知!高龄津贴全面调整,家里有老人的注意别错过

民政厅正式通知!高龄津贴全面调整,家里有老人的注意别错过

笑熬浆糊111
2026-10-01 08:43:50
马科斯这回玩砸了,海牙法庭传来噩耗,老杜家族迎来绝地反击时刻

马科斯这回玩砸了,海牙法庭传来噩耗,老杜家族迎来绝地反击时刻

娱乐的宅急便
2026-10-01 11:45:56
知名投资人曝刘欢真正死因!大家都猜错了,8月他在餐厅状态不错

知名投资人曝刘欢真正死因!大家都猜错了,8月他在餐厅状态不错

笑饮孤鸿非
2026-09-29 03:04:49
俄罗斯光刻机重大突破!

俄罗斯光刻机重大突破!

EETOP半导体社区
2026-09-30 07:37:30
新五年签约落定:华为赛力斯携手再次出发

新五年签约落定:华为赛力斯携手再次出发

汽车说刊
2026-10-01 19:59:27
你有洗屁股的习惯吗?医生提醒:天天洗肛门的人或能预防4种毛病

你有洗屁股的习惯吗?医生提醒:天天洗肛门的人或能预防4种毛病

芹姐说生活
2026-08-21 22:28:55
小鹏集团:某二级供应商员工捏造零部件产线不实信息,将依法追责

小鹏集团:某二级供应商员工捏造零部件产线不实信息,将依法追责

界面新闻
2026-10-01 10:43:46
伊朗内部发生激烈交火!安全部队出动坦克控局,准将级指挥官阵亡

伊朗内部发生激烈交火!安全部队出动坦克控局,准将级指挥官阵亡

闻识
2026-10-01 11:37:44
快讯!台“防长”顾立雄表态了!

快讯!台“防长”顾立雄表态了!

故事终将光明磊落
2026-10-01 20:00:53
刘畊宏直播间凉了,“老板娘”的身材戳破了多少人的减肥梦?

刘畊宏直播间凉了,“老板娘”的身材戳破了多少人的减肥梦?

看尽落尘花q
2026-08-23 19:28:46
回国才敢说句心里话,在俄罗斯,对方知道你是中国人,态度全变了

回国才敢说句心里话,在俄罗斯,对方知道你是中国人,态度全变了

潘軮旅行浪子
2026-09-21 17:07:42
10月1日六大行存款利率更新?22万存三年,哪家利息更高?

10月1日六大行存款利率更新?22万存三年,哪家利息更高?

民市井财策
2026-10-01 17:00:28
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
实锤前兆!欧文交易概率飙升,4换2方案出炉,火箭或成潜在下家

实锤前兆!欧文交易概率飙升,4换2方案出炉,火箭或成潜在下家

体育大朋说
2026-10-01 12:02:55
2026-10-02 02:28:49
IT之家
IT之家
爱科技,爱这里 - 前沿科技人气平台
370502文章数 607584关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

桂林市文促会深夜发布致歉信:向阿丘诚恳致歉

头条要闻

桂林市文促会深夜发布致歉信:向阿丘诚恳致歉

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

教育
家居
游戏
亲子
军事航空

教育要闻

免中考”试点到底改了什么?

家居要闻

2026建博会(广州) 公装联探展交流活动

《战争机器》新作GS 7分:创新不足剧情令人失望

亲子要闻

查出儿童哮喘,恢复的4个关键点

军事要闻

美防长宣布组建“自主作战司令部”

无障碍浏览 进入关怀版