AA竞技场最新榜单一出来,好几家公司茶水间里估计都静了三秒。60分——Kimi K3和GLM-5.3并列站上了国产模型的最高领奖台,也是目前唯二能摸到T1门槛的中国模型。更耐人寻味的是,Kimi K3早在五月就已上线,一个“月更”模型硬是扛住了后续所有新秀的冲击,老树发新芽,反而越跑越稳。月之暗面这波节奏,真有点像打游戏突然换线,不声不响把中路C位抢了,自己还顺手拿了三杀。
![]()
智谱这边倒挺实诚,唐杰直接说GLM-5.3是“只做后训练”的一次极限压力测试:基座不动、参数不改、架构锁死,就看靠数据和对齐能榨出多少油水。结果60分稳稳落地,比不少动了整套架构的“大改版”还扎实。你说这是技术克制,还是另类炫技?反正业内不少人翻着log偷偷复现去了。
往下看,58分的Qwen3.8 Max和52分的Qwen3.8 27B像一对双生子,一个顶着“Max”旗号冲性能,一个27B轻装上阵打价格——Hugging Face上Qwen全家桶今年下载量破20亿次,比第2到第5名加起来还多。开源不是口号,是真有人在用,而且是海量用。至于中间那个53分的DeepSeek-V4-Pro……到现在还有人问,它到底哪儿“卡”住了?Harness极简模式补得挺勤,可用户反馈里高频出现的句子是:“这个定语嵌套得,比我老家三层楼的出租屋还绕。”车圈那套炫技式堆料,放到大模型上,真不一定香。
T3那一片,45分MiniMax-M3、43分MiMo-V2.5-Pro、42分Hy3,基本是“能跑通就上线”的务实派。MiniMax押原生多模,结果视频方向反倒先打出声量;小米MiMo系列在DeepSeek-V4-Flash出来前,在OpenRouter上悄悄做了半年性价比担当,自动化脚本、轻量Agent调用、CI/CD里的模型兜底,雷总财报里那句“AI赋能效率提升”,背后可能就是几十万台服务器在跑MiMo。姚顺雨带的Hy3,是腾讯AI实验室的新起点,WorkBuddy在内网跑通后,OpenRouter上直接把单价砍到同行六成——中美两边,它居然都接得住单。
再往下,38分蚂蚁Ling 3.0 Flash、34分美团LongCat 2.0、31分阶跃Step 3.7 Flash,已经不谈“聪明”了,只比“快”。响应压到300ms以内,token吞吐拉满,推理延迟比你点外卖接单还短。工厂产线上的质检提示、客服后台的实时摘要、IoT设备的边缘推理——这些场景里,模型不是老师,是流水线上的扳手。
最后,22分的ERNIE 5.0。百度没再传ERNIE 5.1进AA竞技场。不参榜,不交卷,不打分。有人截图问:这算交白卷,还是压根没领考卷?对吧?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.