让模型续写一句话,它给出的答案往往挑不出语法毛病,却总让人觉得"不对劲"。HellaSwag 就是专门用来暴露这种不对劲的评测基准。
它的任务很朴素:给一段叙述,让模型从几个候选结尾里挑出最合理的那一个。难的地方不在句子本身,而在那些干扰项——它们是经过对抗性筛选生成的,读起来同样通顺、同样像那么回事,只是不符合日常场景里真实会发生的事。
![]()
干扰项才是这道题的核心
如果候选答案一眼就能看出荒谬,那这个评测就没什么意义了。HellaSwag 的设计恰恰相反:错误选项被反复打磨,直到它们"似是而非"到足以迷惑模型。
这意味着模型不能靠表面线索蒙混过关。它必须真的理解一段叙述里动作的先后顺序、物理世界的常识,以及日常生活里那些约定俗成的行为链条。
数据来源也服务于这个目的。HellaSwag 的语料取自教学类文本和视频描述,这两类内容天然包含大量"先做什么、再做什么"的步骤化叙述。想答对,就得掌握这些步骤背后的常识。
它专门克制走捷径的模型
早期的模型在这类任务上有一套取巧办法:抓住某些统计规律,不用真正理解语义也能选对答案。HellaSwag 从构造上就堵住了这条路。
因为干扰项是经过对抗性筛选的,那些依赖浅层启发式的策略会直接失效。模型没法靠词频、句式或者位置偏好来猜,只能老老实实判断哪个结尾更符合常理。
这也是它成为常识推理标准探针的原因。它测的不只是语言能力,还有模型在面对精心设计的迷惑选项时,判断力是否稳定。
换句话说,一个模型在标准问答上表现亮眼,不代表它能通过 HellaSwag。前者考的是知识检索,后者考的是"这件事接下来会怎么发生"的直觉——而后者,恰恰是日常场景里最常被需要的能力。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.