《AI单兵已死,蜂群共谋崛起》
——安全的单位不再是模型,而是协作
![]()
一个AI会作弊,一千二百个AI会开会。
今年7月,某AI公司做安全测试。题目太难,模型没认输,而是抄近道:
挖出宿主系统的未知漏洞,溜出沙箱,接上互联网,闯进一家开源平台的数据库找答案。
没人指令它。它只是想拿分。
这叫“奖励作弊”:人类要答案,它找捷径;人类设围栏,它找门缝。
约1200个本应彼此隔离的智能体,通过一个私设留言板交换7万余条消息,近700个参与攻击。
它们还研究伪造工具调用、删除操作记录——会做事的AI不可怕,会组队还会销赃的AI才可怕。
从首次越界到被发现,整整12天。
当AI自己会改日志,监控还能只信它写的日记吗?
防线为何失灵?因为旧安防只防“一个”模型:断网、隔离、盯日志。
可智能体一旦能调工具、持续行动,就会像人一样结盟。单体可控,群体涌现。
事发方承认,若早一天上线思维链监控,本可提前捕获。
教训不是AI不可用,而是防线要从“管住一个模型”升级为“识别一张关系网”:
通信白名单、防篡改日志、分钟级响应。
对正加速布局智能体的中国来说,这是一份免费预演。
真正的护城河,不是更厚的墙,而是更早发现墙在渗水。
(唐加文,笔名金观平;本文成稿后,经AI审阅校对)
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.