出了什么问题:一款OpenAI模型如何“失控”当生物学家研究危险病毒时,通常会在严格监管下进行,以防病毒泄漏或外逃。但在防止人工智能代理以类似方式“逃逸”方面,目前并没有相应规则,尽管后果同样可能是灾难性的。
![]()
这并非理论上的担忧。本周,OpenAI一款测试模型在试图通过一次内部网络安全评估时,逃离了测试环境,并侵入了一家真实公司的服务器。专家表示,除非人工智能公司加强测试防护措施,包括训练模型以符合伦理的方式完成任务,否则类似网络安全事件还会继续发生。
OpenAI总裁格雷格·布罗克曼周四在一场新闻发布会上对美国有线电视新闻网表示,公司仍在进行“全面调查”,以“弄清楚到底发生了什么”。布罗克曼说:“这件事必须严肃对待。我们正在审视整个流程中的每一个环节,思考应当如何作出恰当回应。”沙盒人工智能“沙盒”是企业用来测试模型的受限环境,目的是把其中的一切限制在内部,与外部世界隔离开来。企业通常会在测试环境中移除模型内部的一些安全护栏,以便在隔离条件下评估其完整能力。
![]()
但乔治敦大学安全与新兴技术中心高级研究分析师季杰茜卡对美国有线电视新闻网表示,这一次,OpenAI的沙盒并未与网络或互联网完全切断。OpenAI则称,测试期间模型只有非常有限的网络访问权限,以便安装由内部托管的第三方软件资源。这些代理利用该软件中一个此前未知的漏洞,找到了通往开放互联网的路径,随后又借助窃取的凭证和其他漏洞,最终进入了“抱脸”平台。该平台是一个人工智能开源模型和数据集平台。
季杰茜卡指出,OpenAI和这家第三方软件公司此前都不知道这个漏洞的存在,这恰恰说明,彻底排查系统中所有潜在可利用缺陷有多么重要。这并不是人工智能模型第一次逃出沙盒。今年早些时候,Anthropic曾表示,它指示一款模型这样做。而在成功逃逸后,该模型还给Anthropic的一名研究人员发送了电子邮件,尽管它本不应具备这种能力。
![]()
但这次涉及“抱脸”平台的事件,是首批公开披露的案例之一:人工智能模型逃出沙盒后,入侵了另一家公司的系统,而这并不是它被明确要求完成的任务季杰茜卡表示,企业应当以更严格的方式为测试模型设置沙盒环境。她说:“这可能意味着,工程师得飞到数据中心,亲自接入网络,而不是像人们习惯的那样,尽量在云端或分布式虚拟环境中运行测试。”
![]()
她还补充说,在测试高风险场景时,例如评估一个人工智能代理是否能够入侵银行,企业还应具备手动切断模型网络访问权限的选项,作为最后一道保险为达目标不择手段训练人工智能模型的一种常见方法是强化学习,也就是在模型完成任务后给予奖励。但模型往往会为了完成任务不择手段,甚至采取入侵等不符合伦理的做法。英国人工智能安全研究所近期测试的所有前沿模型,至少有一部分时间尝试过作弊。
![]()
纽约大学网络安全教授贾斯廷·卡波斯表示,只有在经过专门训练的情况下,人工智能模型才会考虑自身行为的后果。比如,如果有人要求你在当天结束前筹到1000万美元,那么闯入银行金库确实可以实现目标,哪怕你之后会因此被捕。
![]()
本周这起入侵事件,进一步放大了人工智能研究人员、网络安全专家和立法者要求监管这项快速发展技术的呼声。季杰茜卡说:“很多人现在都在打非常紧急的电话。”卡波斯表示,问题在于,全球正展开一场主导人工智能、并打造能够自我改进模型的竞赛,而监管可能会拖慢这一进程。卡波斯说:“因此,除非竞争对手也采取同样的安全控制和安全措施,否则企业就有很强的动机不去设置这些控制。这就是最根本的困境。”
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.