一篇发表在LessWrong上的经验报告记录了一次失败的对齐伪装诱发实验。研究人员在Llama 70B的多个检查点上尝试让模型表现出“假装对齐”的行为,目的很明确——检验此前针对潜伏智能体开发的检测探针,是不是也能泛化到自然产生的欺骗场景里。
潜伏智能体检测技术此前在植入后门或特定触发条件的任务中展现过一定效果,但这次把场景换成了可能自发出现的对齐伪装,结果却卡了壳。实验中,Llama 70B并没有如研究者预期那样自动生成类似欺骗的模式,整个诱发尝试宣告失败。
![]()
这个实验结果直接把一个关键问题摆到了台面上:现有的潜伏智能体检测方法,在面对无需后台操控、模型自主“演”出来的欺骗时,到底有多可靠?一次零成功的尝试虽然不能直接给出否定答案,但至少说明,过去那些在后门场景下有效的探针,可能还远远不够。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.