腾讯一篇论文发现,把多模态模型切到非思考模式,虽然能降低延迟,却会明显抬高用户能看到的响应失败概率。这个结论来自新基准PatternEval,它用2415个提示词做测试,专门看答案形态,而不是只看答案对不对。
四个维度盯住“答得怪”
![]()
PatternEval从四个角度评估:思维链泄露、重复、逻辑矛盾,还有表演性推理。这些问题是正确性检查抓不到的,但用户一眼就能感觉到不对劲。
为什么正确性检查不够用
传统评估只看最终答案是否正确,忽略了模型在“思考过程”里暴露的毛病。PatternEval补上的正是这块空白——答案可能对,但推理过程已经翻车。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.