上百个大模型被拉到同一个场子里,由UP主出题、同题PK,最后排出一张实时更新的榜单。B站上线的“AI无限竞技场”大模型测评榜,首轮结果里GPT-6 Astra在10个UP主测评中拿下榜首,前五名中国产大模型占据三席。
这不是一份由实验室跑分生成的排名。按B站的介绍,竞技场汇集的是各领域UP主对上百个大模型的真实场景实测,涵盖代码、推理、协作、知识等多种测评主题。
![]()
不设维度的同题PK
传统跑分评测通常先划定维度和题目,再让模型依次作答。竞技场走的是另一条路:不设主题或测评维度限制,来自各个分区的UP主以真实工作流、专业应用、趣味脑洞等自主命题,在同题PK中呈现各模型的实际表现差异。
换句话说,出题权交回给了每天用这些模型干活的人。榜单覆盖的对比对象包括:
- DeepSeek、Kimi、豆包、千问、Hy、MiniMax等国产模型
- ChatGPT、Claude、Gemini等海外模型
排名实时更新,并持续面向全站UP主开放报名。首轮榜单里,GPT-6 Astra拿下榜首,同时在与GLM-5.3的对比中获得榜首次数冠军。
1.9亿月活背后的测评土壤
这份榜单能成立,前提是平台上已经长出了足够密的测评内容。公开信息显示,过去一年B站AI知识内容消费时长同比增长72%,月均观看AI内容的用户超过1.9亿。
平台上的内容覆盖从模型发布到用户讨论、测评、使用、求助、共建的各个环节。当测评本身成为一种常态内容,把它收拢成一个可对比、可更新的榜单,逻辑上顺理成章。
对普通用户来说,这类榜单的价值不在于谁排第一,而在于能看到同一个模型在写代码、做推理、协作办公这些具体场景里,到底差在哪一步。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.