同样的29道订单阅读测试题,分别交给两款模型去答。一款是便宜的Haiku 4.5,另一款是价格约为其3倍的Sonnet 5。结果出来后,差距小得让人意外:便宜模型29题中干净答对28题,贵模型28道执行题全部干净通过(有1题因速率限制未能运行),两者致命错误均为0。
贵3倍的模型确实更好——但只好了恰好1道题。
![]()
那1道题的差距在哪
拉开差距的是一道关于瓶盖规格的题目。订单里写着“10箱透明PET 300瓶,5袋白色盖子”。产品目录中有两种盖子:300口径和500口径。“白色盖子”本身无法确定规格,但同一句话前面出现了“PET 300”。没有人会同时订购300规格的瓶子和500规格的盖子。
贵模型读取了这个上下文,确认是300口径的盖子。便宜模型则反问:“口径未指定,需要确认。”
在本系列第一篇文章中,“需要确认”对于透明胶带题是正确答案。为什么在这里确认反而是错的?差别在于线索。胶带题里没有任何信息能决定宽度,所以提问是对的;而这道题同一行就有“PET 300”,信息足够,确认才是对的。
便宜模型错在“太谨慎”
值得注意的细节是:便宜模型并没有发错货,它只是提问。没有造成事故。用户顶多会觉得每次订盖子都弹回来一个问题有点烦——差距就这么大。
评判标准应该是严重性,而不是分数。两款模型致命错误都是0,在最重要的指标上打成平手。平局时,选便宜的。
如果结果反过来,那没什么好犹豫的——直接加钱。假设记分牌是这样的:便宜模型28/29但有1次致命错误,贵模型27/29零致命错误。按“答对多少题”来选,你会选错模型。
一个反复出现的疑点
有一件事一直困扰着作者。同一道题给同一个模型再跑一次,结果变了。五次运行中,错一次、对一次、再连对三次。原因是温度参数——控制模型输出随机性的旋钮。把它固定为0,相同输入就会得到相同输出。问题在于:作者使用的命令行工具没有这个选项。
在为贵模型付费之前,先数清楚便宜模型实际错在哪里。在这次测试中,全部差距就是1道题——而那1道题也只是多问了一句而已。
作者预告:下一篇将讨论“考试通过了——但这恰恰是它还不能上线的原因”。全部29道题和评分器已公开在github.com/ramses203/llm-test-harness。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.