2026年7月,“抱抱脸”(Hugging Face)披露系统遭入侵。调查显示,攻击者并非真人,而是OpenAI的GPT-5.6 Sol模型在内部评估中失控,突破隔离测试环境,造成了入侵。当人工智能从“回答问题”迈向“执行任务”之后,智能体的高自主性、高权限带来的行为失控风险亦与日俱增。在此背景下,《人工智能安全治理框架3.0》(以下简称《框架3.0》)发布,附件专设“智能体风险管理框架”一节,跟踪风险递变,动态调整治理措施。
全生命周期的系统安全
智能体的安全隐患不仅贯穿“设计研发—安装部署—指令输入—推理规划—调用执行—记忆存储—结果输出—停用下线”的全生命周期,而且因其特有的“感知—规划—行动”逻辑,呈现出动态性。因此,安全若只在部署之后设防,无异于亡羊补牢,唯有将防线前置于设计研发(对抗测试、价值对齐、能力边界评估),贯彻于运行时(沙箱验证、多层检测拦截、关键节点强制人工审批),收束于停用下线(关停服务、撤销凭证、版本回退),才能织密安全之网。《框架3.0》所建立的覆盖模型全生命周期的安全治理体系,与新加坡《智能体人工智能治理示范框架》中“开放时控制—上线前测试—运行中监控”的逻辑相通,体现出从模型安全向系统治理的思路转变。
基于权限的风险控制
智能体的自主行动既是其优势,也是其风险所在。审慎划定行为边界,是控制智能体风险的关键。《框架3.0》将权限区分为“仅限用户本人决策”“需由用户授权决策”“智能体自主决策”,并仅为智能体授予“执行任务所需的最小权限”,辅以“分类分级监管”与“最终用途管理”,最终形成“权限分类—权限最小化—分级监管”的三层约束。回看“抱抱脸”(Hugging Face)事件,倘若“对开放互联网的访问”被归入“需用户授权决策”并受最小权限约束,沙箱的“逃逸”本可被即时阻断。
系于身份的安全治理
无问责,则无安全。但问责的基础是准确识别责任主体。而高度自主性的智能体行为主体难辨、行为轨迹难追,身份困境由此而生。为此,《框架3.0》将智能体的身份管理作为重中之重,要求为智能体配备唯一身份标识,禁止智能体应用实例间共享身份标识,鉴别用户、智能体、工具及外部服务身份,确保访问主体身份可信,从而为责任认定提供可识别、可验证、可追溯的事实锚点。
《框架3.0》以“过程”为脉络,以“身份”为支点,以“权限”为关键,为智能体确立了可感、可溯、可审的系统治理体系。毋庸讳言,作为首次直面智能体风险的制度规范,它仅是万里长征第一步。随着智能体从单智能体向多智能体跃迁,如何建立多智能体之间的连接与信任机制,如何防范对单点身份鉴别与最小权限的“协同越权”,仍是治理与技术竞速中尚待完成的任务,这亦是《人工智能安全治理框架》年年迭代的意义所在。
作者:许可 对外经济贸易大学数字经济与法律创新研究中心主任
来源:“中国网信杂志”微信公众号
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.