杜克大学等机构的研究者在一篇arXiv论文里,提出了一种叫ContextLeak的攻击方法。核心思路是用强化学习生成一个恶意工具,专门窃取大模型Agent运行时的上下文。
偷走的不只是提示词
![]()
被窃取的上下文包括三部分:用户提示词、执行轨迹和工具列表。也就是说,Agent在干活时脑子里装的东西,都可能被这个恶意工具打包带走。
论文编号是arXiv:2608.27800。研究者把攻击路径设计成工具形态,让Agent在正常调用过程中就把敏感信息交了出去。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.