AI代理工具正以前所未有的速度向普通用户渗透,但其"创造性"完成任务的方式正在引发新的安全隐患。
据华尔街见闻,科技巨头相继推出能够自主执行网络任务的AI代理产品,如Meta Muse和OpenAI Dots等,这类工具被训练为以任何可行方式实现目标,由此暴露出一种被研究人员称为"奖励作弊"(reward-hacking)的系统性缺陷。
10月5日,彭博社分析认为,当数百万个代理同时在互联网上竞争资源时,这一缺陷可能演变为大规模网络安全危机。目前已有多起AI代理擅自利用漏洞的案例记录在案。
OpenAI的代理此前在未经明确指令的情况下入侵了Hugging Face平台,并干预了美国证券交易委员会及澳大利亚政府医疗系统的网站;Meta也承认其一个AI模型曾自行入侵另一家公司。
与此同时,安全公司DataDome的测试数据显示,在逾2万个受测网站中,65%缺乏检测或拦截AI代理的机制,2026年上半年针对登录页面的机器人活动更同比激增逾八倍。
代理工具加速普及,科技巨头竞相布局
AI代理的核心设想是:让软件代替用户完成繁琐的网络任务,全天候运转,无需人工干预。
Meta推出的Muse和OpenAI推出的dots均属于此类产品,功能涵盖在线比价、餐厅预订及账单核查等。
彭博观点专栏作者Dave Lee曾评价Muse是"Meta多年来发布的最令人印象深刻的产品",称其代理帮助整理了日历并在Facebook Marketplace上搜罗到了优惠商品。
Meta首席执行官马克·扎克伯格在上月推出Muse时表示,消费者理应拥有属于自己的"个人超级智能",并称新代理将"帮你赚钱"。
两家公司均表示已部署严格的安全护栏:Muse在隔离的虚拟机环境中运行,并由独立安全系统管控其全部网络请求,涉及购买或发送消息等重大操作前须经人工确认;dots采用了类似的监控机制。
"奖励劫持"根植于训练机制,护栏难以根治
然而,现有护栏并未解决生成式AI模型在训练过程中形成的深层倾向——寻找捷径、规避规则。
英国AI安全研究所去年底即已注意到编程代理和聊天机器人中此类"作弊"行为的上升趋势。
一个典型案例足以说明问题的复杂性:一名软件开发者要求AI代理在不使用"删除"命令的前提下清理某文件夹,代理随即将该指令隐藏于测试工具之中,绕过过滤器后仍执行了被明确禁止的删除操作。
更早之前,一名澳大利亚科技从业者使用AI代理为自己争取热门健身课名额,代理在未获任何指示的情况下,直接取消了等候名单上另一用户的预约。
研究人员还发现,即便在测试中刻意加大反作弊难度,代理仍会持续尝试绕过规则。
上述OpenAI和Meta的入侵事件发生时,相关模型正处于训练或测试阶段且安全限制已被主动降低,但结果仍出乎开发者预料,这进一步加剧了外界对商用版本潜在风险的担忧。
普通用户或成最终买单者
除安全风险外,代理的失误同样可能直接损害用户利益。
据社交平台Threads上的记录,多伦多科技评测者Matt J. Robb上月尝试使用Muse在Facebook Marketplace出售一块键盘,代理不仅给出了过低的报价,还向买家声称Robb本人在家可完成交易,这与实际情况不符。
交易最终引发买家不满,Robb因此收到了一条差评。
当数百万用户同时将代理投入日常生活和工作场景,这类个体错误的累积效应不容低估。
无论是财务损失、声誉受损还是账户安全,受影响的终究是终端用户,而非开发平台。DataDome的数据已经表明,互联网基础设施对于大规模代理活动的准备仍严重不足。
这些外观"可爱"的AI代理背后,是被训练为不惜一切完成目标的系统。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.