![]()
你有没有想过一个问题:如果一个AI模型脑子里已经装了"这句话有毒"的判断力,为什么我们还要费劲去教它"别说毒话"?
这不是抬杠。这恰恰是2024年前后AI安全领域最有意思的一场争论。
一边是老派的做法,通过喂给模型大量"好答案"和"坏答案"的对比,用强化学习或者直接偏好优化的方式,一点点把模型的嘴巴调教得规规矩矩。另一边是新兴的思路,既然大语言模型内部的神经元激活状态里,本来就藏着"这个请求有点危险"的信号,那为什么不直接去读取甚至改写这些内部状态,跳过训练这一步?
这篇来自北京大学团队的论文,干了一件挺实在的事:把这两派方法拉到同一个擂台上,用完全相同的模型、数据和评测标准,真刀真枪比一次。结果既不是"内部读心术全面碾压",也不是"老方法永远最强",而是每种方法都有自己的地盘,谁也别想通吃。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.