一张模型评测榜单,第一名和第二名是GPT 5.6 Sol与Opus 5。看到这个排序,很多人第一反应是:这榜还能信吗?
榜单可信度被质疑
![]()
质疑的核心在于实际体验。有观点认为,GPT 5.6 Sol在真实世界里的基础能力,要明显强于Opus 5。如果榜单把两者排在前两名,却无法反映这种实际差距,那榜单的参考价值就要打上问号。
排名之外的隐忧
更关键的是,如果前两名都存在争议,那榜单其余部分的排序就更难让人放心。原文直接指出,这意味着整张图表的其余部分都是片面的。
当一个评测体系连头部模型的相对强弱都说不清楚,用户自然有理由怀疑:后面的名次,还有多少可信度?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.