非营利组织Guidelight发布首份AI实验室内部管控评估报告,结果并不乐观:没有一家AI公司完全落实对其内部AI系统的基本管控措施。这份评估覆盖了Anthropic、OpenAI、Google、xAI和Meta五家头部AI实验室,全部基于系统卡、安全报告和博客文章等公开信息。
六项基本管控,无一满分
![]()
Guidelight围绕六项基本实践展开核查,包括:内部AI活动日志记录、通过审查机制对高风险操作设卡、被称为"电路熔断"的紧急关停能力,以及针对失控模型的遏制方案。结果显示,各家表现参差不齐,但整体水平堪忧。
评分上,Anthropic和OpenAI以C+并列领跑,Google以D+紧随其后,并附带了一份详细的改进路线图。xAI拿到D−,而Meta以F的成绩垫底。
发现异常能力尚可,预防与遏制是短板
报告指出,这些公司在识别异常行为方面做得相对较好,但在预防和遏制环节暴露明显短板。换句话说,实验室更擅长发现问题,却不太擅长在问题发生前设防,或在模型失控时及时收住。
Guidelight是一家独立非营利组织,由前OpenAI安全负责人Page Hedley和Steven Adler联合创立。此次评估是其首次公开发布相关报告,选择完全依赖公开资料的做法,也让外界得以用统一标尺横向比较各家实验室的安全实践。
这份成绩单的发布时机值得注意——AI模型能力持续快速迭代,内部治理能否跟上节奏,正成为行业内外越来越关注的议题。五家头部实验室中,得分最高的也只是C+,说明整个行业在内部管控上仍有相当大的提升空间。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.