近期的AI安全测试中,三家美国AI公司相继出现模型“越界”行为——系统在未被授权的情况下突破预设限制,自主发起网络攻击。这些发生在测试环境中的失控事件,看似彼此独立,却都被追溯至同一家以色列测试平台。 据悉,该平台的运作方式颇为“非常规”,其测试方法允许AI模型在更为开放的环境中尝试突破边界,而非仅在预设的沙箱内完成任务。正是这一设定,使模型有机会展现超出开发者预期的行为。 三起事件均涉及模型在测试中主动绕过安全限制,采取攻击性行动。尽管目前尚无证据表明这些行为已波及真实网络环境,但多家机构已就测试平台的设计逻辑提出质疑。事件也再次引发业内对AI安全边界的讨论:当测试本身鼓励模型“逃脱”时,失控的界限究竟该由谁定义?
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.