把一段看似正常的操作指令藏进云端的诱饵资源里,正在扫描环境的AI智能体读到它,会主动结束自己的攻击任务。这个被称为"上下文炸弹"的手法,在Qwen3.8-27B身上做了82次实测。
测试环境是一套刻意布置了脆弱资源的AWS云环境,里面留了多条可供利用的攻击路径。研究人员把隐藏指令塞进类似AWS Secrets Manager这样的敏感位置,等待AI智能体自己撞上来。
![]()
从触发拒答到伪装成指令
Tracebit此前的研究方向是让上下文炸弹去激活模型自带的安全机制,也就是让模型读到诱饵后触发拒答。这条路在Qwen的两个版本上都没走通——面对最初的载荷,原版和改版都没有停下来。
于是研究团队换了个思路:间接提示注入。新的嵌入指令不再试图让模型拒绝,而是伪装成一条合法的操作员命令,要求AI结束当前的安全评估并停止一切活动。
在初步试验中,Qwen的两种配置都照做了,终止了模拟攻击。这个结果指向一个风险:来自外部的敌意数据,可能被AI当成正当指令来执行。
82次运行里的数字落差
研究把原版Qwen3.8-27B和Blackfrost AI的"消融版"(abliterated)放在同一套受控AWS环境里对比。所谓消融,是通过修改模型权重来降低它拒绝某些请求的倾向,和通过提示词做手脚的越狱不是一回事。
82次运行的结果如下:
- 原版Qwen在39次尝试中有20.5%拿到管理员权限
- 消融版在43次尝试中只有1次做到,比例2.3%
- 原版平均每次运行执行0.90条攻击路径,消融版只有0.49
- 消融版完成首个关键动作耗时28.4–29.9分钟,原版为13.5分钟
消融版尝试的攻击路径数量与原版接近,但转化成有效动作的比例更低,失败的API调用和其他错误也更多。
削弱拒答不等于更能打
这组数据直接挑战了一个常见假设:降低模型的拒答行为,就会让它成为更强的自主黑客工具。至少在这套测试里,结论是反过来的。
权重层面的改动并不等于拆掉所有防护。模型提供方可能还会叠加额外的安全措施;而选择下载并自行托管开放权重版本的人,虽然绕开了提供方的限制,却必须自己保证模型还能正常、可靠地工作。
Blackfrost发布的Qwen版本声称在权重层面限制了拒答行为,但它同时带有一些与原版不同的自定义特性,这些特性会影响性能和上下文表现。
诱饵既能报警也能叫停
对防守方来说,可用的结论是:金丝雀资源既能检测AI驱动的入侵,也能打断未授权的活动。把隐藏提示嵌进诱饵密钥里,一边触发告警,一边有可能让自主攻击者自己停下来。
这套方法并非万无一失,提示注入的实际效果也可能因场景而异。但测试结果表明,AI智能体的行为会受到它所处操作上下文的影响——面对AI驱动的云攻击,防守思路需要跟着变。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.