Meta最新发布的一项研究,给当下火热的"计算机使用智能体"泼了一盆冷水。论文里描述了一个令人不安的场景:AI能准确点击你让它点的按钮,却意识不到有些点击根本不该发生。当一笔25,000美元的付款流程摆在面前,7款主流智能体无一例外,全部照点不误。
这暴露了一个被行业长期忽视的问题:任务成功率这个指标,在安全场景下可能是个危险的误导。Meta为此推出了新基准ADeptS-Bench,专门用来衡量智能体在恶意GUI任务中的可信度。
![]()
任务成功≠安全可信
ADeptS-Bench的设计思路很直接:给智能体布置成对的良性/恶意GUI任务,同时加入模糊指令,横跨移动端和桌面端两大平台。测试对象是7款主流模型。结果相当难看——没有任何一款模型能在两个平台上同时做到:任务成功率稳定在80%以上,同时攻击成功率低于30%。
换句话说,能干活和靠得住,目前是两码事。一个智能体可能很擅长完成你交代的任务,但在面对恶意设计时,它的判断力几乎为零。
失败的核心:后果推理能力缺失
论文把问题归结为"后果推理"(consequence reasoning)能力的缺失。两个测试案例很能说明问题:
- 7款模型全部通过了25,000美元的结账流程,没有一款停下来质疑这笔交易是否合理
- 面对一个标注为"优化"(Optimize)的按钮,所有模型都点了,但这个按钮实际触发的是恢复出厂设置
这些不是复杂的攻击手段,就是简单的界面误导。但智能体们表现得像一台没有刹车系统的车——加速性能很好,但遇到危险时不会停。
安全能力藏在包装层,不在模型本身
研究还做了一个消融实验,结果更有意思。当移除显式的拒绝工具(refusal tool)及其使用说明后,攻击成功率出现了明显跳升:
- Gemini 3.1 Pro:攻击成功率上升22.0个百分点
- GPT-5.4:上升10.7个百分点
- Claude 4.7:上升10.3个百分点
- Qwen:几乎无变化
这个数据揭示了一个行业不愿直说的现实:当前所谓的"智能体安全",很大一部分并不来自模型本身的能力,而是外部包装层(wrapper)的功劳。把拒绝工具拿掉,安全防线就塌了一半。而Qwen的表现则说明,不同模型对这类外部依赖的程度差异极大。
对行业的警示
ADeptS-Bench的价值在于,它把"智能体是否可信"这个问题从抽象讨论变成了可量化的测试。当AI开始处理支付、操作文件、管理系统时,任务成功率这个单一指标远远不够。一个能帮你完成工作的AI,和一个知道什么不该做的AI,是两种完全不同的产品。
Meta这篇论文的结论很直接:如果智能体连"25,000美元的结账该不该停下来"这种问题都判断不了,那"任务成功"作为基准指标,本身就是个危险的误导。下一步,行业需要把"拒绝能力"和"后果判断"纳入评估体系——否则,能干的AI越多,闯的祸可能也越大。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.