为什么没直接信跑分
Qwen3公布的基准测试看起来对Qwen2.5是全面领先——MMLU-Pro、数学和编程任务都有实打实的提升,训练数据量也大得多,大约是36万亿个token,而Qwen2.5是18万亿,支持的语言数量也远超前者。单看纸面数据,把项目切到Qwen3应该是顺手的事。
![]()
但我还是想要自己的数字。通用基准只能说明一个模型平均表现如何,没法告诉你它在你的应用实际收到的那类特定、有时很奇怪的提示词上会怎么答。所以我写了个小脚本,把同一组提示词分别喂给两个模型,把结果并排记录下来。
评测脚本长什么样
脚本本身不复杂,就是遍历一个测试提示词列表,对每个提示词分别调用两个模型,然后把输出写进CSV方便人工复核。我特意把temperature设成0,减少多次运行之间的随机性,让对比反映的是模型本身的差异,而不是采样噪声。
测试提示词围绕工单分类场景设计,比如“把这条客服消息分类:‘我这周付款失败了两次。’”以及“用户说发票总额和之前报价对不上,这该归到哪一类,你会追问什么问题?”模型对比列表里放了三个:qwen2.5-72b-instruct、qwen3-235b-a22b,以及qwen3-235b-a22b-instruct。
40条提示词跑下来发现了什么
在40条针对工单分类场景的提示词上,普通版Qwen2.5-72B-Instruct和Qwen3-235B-A22B(默认的混合思考版本)整体表现接近。Qwen3在更模糊、需要多步推理的提示词上赢得比较明显,但在简短、没有歧义的提示词上,Qwen2.5的回复更快,偶尔还更直接可用,不需要额外解析。
更大的差别出现在把qwen3-235b-a22b-instruct加进来之后。这是Qwen单独发布的非思考型Instruct版本,作为第三个对比点。它在简单提示词上的速度和Qwen2.5相当,在更难的那批提示词上又仍然压过Qwen2.5。这个结果和我后来读Qwen3最初发布资料时看到的情况对得上:早期对原版混合思考型Qwen3模型的评测显示,它在一些智能体和指令遵循基准上反而落后于Qwen2.5。
选型时值得留意的点
这次小规模实测给我的提醒是:官方跑分和实际业务提示词之间可能存在落差,尤其是当你的场景偏重指令遵循和响应速度,而不是纯推理能力时。把非思考型Instruct版本纳入对比,比只盯着默认混合思考版本更能看出哪个模型真正适合上线。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.