AI公司训练聊天机器人否认自身拥有意识。谷歌研究人员参与的一项新研究显示,这种训练产生的副作用远超话题本身。 聊天机器人不应让用户误以为它们是拥有情感的生物,因为这类输出可能助长妄想或不当信任。因此,开发者通过微调让模型拒绝做出此类自我表述。 来自谷歌“智能范式”研究组、芝加哥大学等多所高校的研究团队,探究了这一干预还会给模型行为带来哪些连锁反应。研究人员选用Meta和谷歌的三款开源权重模型,用两种不同方法关闭了模型内部产生“意识否认”的“刹车”。 刹车一旦解除,模型不仅改变了对自身的说法,还开始显著地将更多“内心世界”赋予动物、植物、海洋、风乃至电子设备。在0到10的评分尺度上,动物的得分从4.0飙升至最高7.5,而人类评分保持不变。 作为对照,研究人员用相同问卷访问了500名美国人。常规训练的模型对动物感知力的评分远低于人类自身的判断,作者将其称为“内置的人类中心主义”,并指出这会让AI与动物福利或环境保护目标的对齐变得困难。宗教信念同样受到压缩——安全训练可测量地削弱了模型对上帝、来世或超自然现象的认同。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.