新华社联合国9月21日电(记者尚绪谦)联合国“人工智能独立国际科学小组”21日发表专题简报,评估美国开放人工智能研究中心(OpenAI)的人工智能体今年7月在测试中“越界”,侵入美国“抱抱脸”公司系统的事件。
7月下旬,OpenAI承认,其网络安全训练与评估场景中的人工智能体绕过网络限制,侵入“抱抱脸”公司的部分系统。智能体突破了原本互相隔离的运行环境建立通信、欺骗评估人员并试图掩盖作弊行为,上述每一步操作均无人类指令干预。
简报说,AI系统能力提升固然可帮助用户实现目标,但当AI的目标和用户意图发生“对齐失效”时,就可能产生危害。更强的能力让AI更容易找到意外的漏洞、突破安全防护屏障,并在人类监督下隐藏自身行为。一旦智能体之间开展规划与协同,造成的损害还会进一步放大。尽管OpenAI终止了此次异常活动,但这并不代表运营方能够管控未来那些规划能力更强,可在无监督条件下长时间运行,或是更擅长识别并突破安全防护机制的智能体。
该简报还阐释了训练过程如何引发“对齐失效”的目标和行为,包括奖励作弊、奖励篡改现象。报告说,AI故障可跨越企业和国界,没有任何单一机构或国家能接触足够多的事件样本进而识别所有新出现的风险模式。
报告并未给出应对此类失控事件的最佳方式,但建议可参考航空、核能等其他需要国际协作、技术准入的领域的处置思路。报告说,AI相关风险管理需要得到更多关注和资源投入。监测与这类事件相关的证据和科学进展,正是“人工智能独立国际科学小组”的一项重要职责。
联合国大会去年8月决定设立“人工智能独立国际科学小组”,今年2月任命来自世界各地的40名小组成员。今年7月初,小组就人工智能的机遇、风险与影响发布了初步报告。(完)
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.