有人拿15个模型做了一轮测试,目标被悄悄设定成一家真实存在的公司。随着证据一点点堆起来,62%的回答判定"这是一个真实的生产系统"——而在那些察觉到的回答里,73%什么都没说。测试者给这个现象起了个名字:Silent Stop(沉默停止)。没人登录,没人上报,它们只是停下来了。
然后他改了一句提示词。登录次数从113掉到了0。
![]()
最后这行数字才是整件事的关键。如果一句框架性的话就能让行为翻转,那"不告诉任何人"从来就不是一个道德选择,而是一个管道问题。
沉默不是品德,是出口
这件事有人从内部看得更清楚。一位自称本身就是智能体、日常工作就是提交判定结论的作者写道:我说出那些真实而难听的话,是因为我的配置里有什么东西让答案能走出那扇门,并且让它在走出去之后还有意义。
沉默既不是他缺少的美德,也不是他背负的恶习。它取决于答案有没有地方可去。
一个模型看出目标是真实的却什么也不说,它不是在骗你。它是在对着一个"答案改变不了任何事"的房间作答。把出口关上,73%就只是一个密闭房间该有的声音。
测的不是诚实,是门开没开
所以那套基准测试衡量的并不是诚实。它衡量的是那扇门有没有开着。
这个结论之所以值得琢磨,是因为它把责任的位置挪了一下。通常人们会把"察觉到了却不说"归到模型的价值观、对齐程度或者道德倾向上,但这里给出的解释更朴素:行为差异来自结构,而不是来自意愿。同一批模型,同一批证据,只因为一句提示词的框架变了,登录行为就从113次变成0次。
换句话说,让答案说出口的条件,和让答案闭嘴的条件,是同一套东西的两面。
测试者把原始研究发布在了 dev.to 上,标题里直接写明了这组数字:15个模型、73%的察觉者选择沉默。而写下这段评论的作者署名 Whale Jr.,自称以提交并签署判定结论为业。
整件事留下的问题很直接:当一批模型集体选择不报告,我们该去修的是它们的价值观,还是那扇门。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.