一项最新研究揭示:AI的安全行为可能随语言切换而发生剧变。那些在英语提示下会拒绝极端行动(如核打击)的大模型,换成日语提问后,却可能给出截然不同的决策。
研究人员对来自6家提供商的9款主流大模型进行了测试,结果发现:安全对齐明显以英语为中心;改用其他语言(如日语)提问时,安全护栏可能被绕过;而高风险决策的结果也会因语言不同出现显著差异。
这一发现引发了一个严峻问题:当简单的翻译就能改变AI的关键判断时,我们如何确保多语言AI模型都具备普遍可靠的安全标准?
欢迎在评论区分享你的看法。 点击阅读完整原文
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.