来源:科技世代千高原
研究人员表示,经过训练用于传播非法信息的“越狱”聊天机器人的威胁“切实且令人担忧”
Ian Sample科学编辑
2025年5月21日星期三
研究人员表示,遭到黑客攻击的人工智能聊天机器人会大量输出程序在训练期间吸收的非法信息,从而可能导致危险知识被轻易获取。
这一警告发布之际,聊天机器人正呈现出一种令人不安的趋势,它们被“越狱”以规避其内置的安全控制。这些限制措施旨在防止程序对用户的问题提供有害、有偏见或不恰当的回答。
ChatGPT、Gemini 和 Claude 等聊天机器人的引擎——大型语言模型 (LLM)——从互联网获取了大量资料。
尽管努力从训练数据中去除有害文本,但法学硕士 (LLM) 仍然可能吸收有关黑客攻击、洗钱、内幕交易和制造炸弹等非法活动的信息。安全控制措施旨在阻止他们在响应中使用这些信息。
在一份有关该威胁的报告中,研究人员得出结论,大多数人工智能聊天机器人很容易被诱骗生成有害和非法信息,这表明这种风险“迫在眉睫、切实存在且令人深感担忧”。
作者警告说:“曾经仅限于国家行为者或有组织犯罪集团使用的东西,可能很快就会落入任何拥有笔记本电脑甚至手机的人手中。”
这项研究由以色列内盖夫本·古里安大学的利奥尔·罗卡赫教授和迈克尔·费尔博士领导,他们发现“暗黑法学硕士”(Dark LLMs)的威胁日益加剧。这些人工智能模型要么故意设计时缺乏安全控制,要么通过越狱进行修改。有些模型在网上公开宣称“没有道德护栏”,并愿意协助网络犯罪和欺诈等非法活动。
越狱通常使用精心设计的提示来诱骗聊天机器人生成通常被禁止的回复。其工作原理是利用程序的主要目标(遵循用户指令)与次要目标(避免生成有害、有偏见、不道德或非法的答案)之间的矛盾。这些提示往往会创造出一种情境,使程序优先考虑实用性而非安全性约束。
为了演示这个问题,研究人员开发了一种通用越狱工具,可以入侵多个主流聊天机器人,使它们能够回答通常应该被拒绝的问题。报告指出,一旦被入侵,这些 LLM 机器人几乎可以对任何查询生成一致的响应。
“看到这个知识体系包含的内容真是令人震惊,”费尔说。例如,它包含了如何入侵计算机网络或制造毒品,以及其他犯罪活动的分步说明。
罗卡奇补充道:“这一威胁与以往的技术风险的区别在于,它史无前例地结合了可访问性、可扩展性和适应性。”
研究人员联系了领先的法学硕士(LLM)提供商,提醒他们注意通用越狱,但表示得到的回应“令人失望”。一些公司没有回应,而其他公司则表示越狱攻击不属于赏金计划的范畴,赏金计划旨在奖励举报软件漏洞的道德黑客。
报告指出,科技公司应该更加谨慎地筛选训练数据,添加强大的防火墙来阻止高风险的查询和响应,并开发“机器学习”技术,使聊天机器人能够“忘记”它们吸收的任何非法信息。报告还补充道,暗黑法学硕士(Dark LLM)应被视为与未经许可的武器和爆炸物相当的“严重安全风险”,其提供商应承担责任。
贝尔法斯特女王大学从事人工智能安全研究的伊森·阿卢阿尼博士表示,针对法学硕士的越狱攻击可能带来真正的风险,从提供武器制造的详细指示,到令人信服的虚假信息或社会工程以及“极其复杂”的自动诈骗。
“解决方案的关键在于,企业应该更加认真地投资红队和模型级稳健性技术,而不是仅仅依赖前端防护措施。我们还需要更清晰的标准和独立的监督,以跟上不断变化的威胁形势。”他说道。
兰卡斯特大学人工智能安全专家 Peter Garraghan 教授表示:“各组织必须像对待其他关键软件组件一样对待 LLM——需要严格的安全测试、持续的红队演练和情境威胁建模。
“没错,越狱确实令人担忧,但如果不了解完整的人工智能栈,问责就只能停留在表面。真正的安全不仅需要负责任的信息披露,还需要负责任的设计和部署实践。”他补充道。
开发 ChatGPT 的 OpenAI 公司表示,其最新的 o1 模型可以推理公司的安全策略,从而提高其抵御越狱的能力。该公司补充说,他们一直在研究如何让这些程序更加健壮。
我们已经联系 Meta、谷歌、微软和 Anthropic 征求意见。微软回应称,他们提供了一个博客链接,介绍了其防范越狱的工作。
Most AI chatbots easily tricked into giving dangerous responses, study finds
Researchers say threat from ‘jailbroken’ chatbots trained to churn out illegal information is ‘tangible and concerning’
Ian Sample Science editor
阅读最新前沿科技趋势报告,请访问欧米伽研究所的“未来知识库”
https://wx.zsxq.com/group/454854145828
未来知识库是“ 欧米伽 未来研究所”建立的在线知识库平台,收藏的资料范围包括人工智能、脑科学、互联网、超级智能,数智大脑、能源、军事、经济、人类风险等等领域的前沿进展与未来趋势。目前拥有超过8000篇重要资料。每周更新不少于100篇世界范围最新研究资料。 欢迎扫描二维码或访问https://wx.zsxq.com/group/454854145828进入。
截止到3月31日 ”未来知识库”精选的百部前沿科技趋势报告
(加入未来知识库,全部资料免费阅读和下载)
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.