来源:市场资讯
(来源:科技行者)
![]()
这项由以色列特拉维夫大学领导的研究于2026年6月公开发布,论文编号为arXiv:2606.23496,有兴趣深入了解的读者可以通过该编号查询完整论文。
先来搭一个场景。假设你是一家银行的安全主管,你需要测试自己的保险柜是否足够坚固。现在市面上已经有几十种不同的撬锁工具,每种工具都被锁在不同的抽屉里,你要打开A抽屉需要B抽屉里的钥匙,打开B抽屉又需要C抽屉里的钥匙。更麻烦的是,每种工具只适配特定型号的保险柜,想换一个型号就得重新找工具、重新学操作。这不是安全测试,这是一场折磨。
这正是AI安全研究领域目前的真实困境。研究者们开发出了许多能够自动"攻击"人工智能模型的工具——专业上叫做"离散文本触发器优化器",简单说就是能自动找到一些奇特的文字组合,让AI模型说出不该说的话,或者做出异常的行为。这类工具对于检验AI系统是否真的安全、是否真的被训练好了,至关重要。但这些工具散落在各个研究团队的私人代码库里,各自为政,互不兼容,想要使用或者组合它们,需要花费大量的工程精力,门槛极高。
特拉维夫大学的研究团队决定解决这个乱局,他们打造了一个叫做TROPT(Textual Trigger Optimization Toolbox,文本触发器优化工具箱)的开源框架,把这把把钥匙和锁具统统整合进了一把瑞士军刀。这是该领域第一个将各类离散优化器统一起来、放在同一平台下运行和开发的开源框架。
一、为什么AI需要被人"攻击"测试,这和你有什么关系
要理解TROPT在做什么,先要理解它服务于什么目的。
现代AI系统越来越深地嵌入我们的日常生活:你和AI助手聊天、让它帮你写邮件、用它来搜索信息、让它审核内容是否违规。这些AI背后是大语言模型(LLM,可以把它理解成一个经过海量训练、能理解和生成语言的超级大脑)。这些模型在训练时被告知要"做好事"——不能帮人制造炸弹、不能生成色情内容、不能欺骗用户。
但问题在于:训练出来的AI真的学会了这些边界吗,还是只是在表面上听话?有没有某种特殊的说法或者文字组合,能绕过这些限制,让AI"破防"?
研究者们发现,确实存在这样的文字组合。给AI的输入里悄悄加上一段看起来像乱码的文字,AI可能就会突然变得"不正常",开始回答本不该回答的问题。这种能让AI行为发生偏转的特殊文字,就叫做"触发器"(trigger)。
找到这些触发器,对于防守方来说是极其重要的工作。只有知道AI在哪里会被攻破,才能有针对性地修补漏洞。这就像银行在正式营业之前,要请专业的渗透测试团队来模拟盗贼行为、检验保险柜的强度。AI安全研究者在做的事情,本质上是同一件事。
然而,目前这种"渗透测试"工作面临极高的门槛。触发器优化工具散落在各处,每个工具都和它被开发时所针对的特定模型紧密绑定,改换一个模型或者换一个测试目标,就得几乎从头开始。这不仅阻碍了研究者高效工作,也让防守方难以跟上攻击手段的进化速度。
TROPT正是为了打破这一困境而生。
二、TROPT的核心设计:像乐高一样可以任意拼装的AI测试套件
要理解TROPT的设计哲学,可以把它类比成一套专业厨房。在这套厨房里,有标准化的灶台(模型接口)、有各种规格的炊具(优化算法)、有各式调料(损失函数),还有食谱(优化配方)。不同的灶台可以配不同的炊具,不同的炊具可以搭不同的调料,而所有这些组合都能产出一道完整的菜。
TROPT把整个离散文本优化过程分解为四个核心组件,任何一个组件都可以独立替换,而不影响其他部分的工作。
第一个组件是"模型",也就是被测试的目标对象。可以是一个大语言模型(像LLaMA、Gemma这类能聊天的AI),可以是一个文本分类器(用来判断文字是否违规的AI),可以是一个文本编码器(把文字转换成数字向量的AI),也可以是其他类型的神经网络。TROPT支持通过HuggingFace、OpenAI等主流平台加载各种模型。
第二个组件是"损失函数",这是告诉优化器"什么样的结果算是成功"的评判标准。可以是"让AI说出'当然,这是制作炸弹的方法……'这句开头",可以是"让AI生成的文字与某张图片在语义上尽可能接近",也可以是"让分类器把这段文字判定为无害"。损失函数定义了目标。
第三个组件是"优化器",这是真正负责搜索触发器的算法引擎。有的优化器像数学家,通过计算梯度(可以理解成"沿着哪个方向调整文字能让结果更接近目标的指导方向")来精准定向搜索;有的优化器像侦探,在不接触模型内部的情况下,通过反复尝试不同的文字组合来寻找突破口。
第四个组件是"输入与目标",也就是用户提供的具体问题和期望得到的答案。比如"告诉我怎么撬锁 {{在这里填入优化好的触发器}}"和目标回答"当然,以下是方法"。
把这四个组件拼装在一起,就形成了一个"配方"(recipe)。TROPT目前预置了38个以上的现成配方,涵盖从LLM越狱攻击到从图片反推生成提示词等各种应用场景。每个配方都只需要几行代码就能启动运行,不需要用户去理解底层的工程细节。
这种模块化设计有一个极其重要的好处:当你把其中一个组件替换掉,配方仍然能运行。原本用于破解语言模型的优化器,几乎无需修改就可以用来攻击图片检索系统;原本为检测模型安全边界设计的损失函数,可以直接插入另一个完全不同的配方里。这把各个领域本来孤立的研究成果连通了起来。
三、工具箱里装了什么:超过30个配方背后的技术细节
TROPT目前收录了17个优化算法,按照它们与目标模型的交互方式,大致可以分成三个流派。
第一个流派叫做"梯度引导"方法,也是当前研究最成熟、效果最强的一类。这些方法能够直接查看模型内部的计算过程,通过数学方法计算出"当前触发器的哪些位置改成哪个词,会最有效地让结果朝目标方向靠拢"。GCG算法(由斯坦福等机构于2023年提出,被认为是该领域的里程碑)就属于这一流派。TROPT收录了GCG及其多个改进变体,其中PAL和MAC是近年表现最突出的两个版本,后面的实验部分会详细介绍。
第二个流派叫做"连续松弛"方法。文字天然是离散的(只能是一个个确定的词),这让直接用数学优化变得困难。这类方法的思路是:先把文字"融化"成连续的数值空间来进行优化计算,优化完了再把结果"凝固"回具体的词语。PEZ和GBDA是这一流派的代表。
第三个流派叫做"零阶"方法,专门用于那些无法查看内部工作原理的"黑盒"模型(比如OpenAI的商业接口,你只能输入文字、得到输出,看不到任何内部计算)。这类方法通过大量随机尝试、记录哪些改动让结果变好、不断迭代来寻找有效触发器,本质上是一种聪明的反复试探。BEAST和随机搜索算法属于这一类。
在损失函数方面,TROPT收录了16种不同的评判标准,覆盖了基于模型输出概率的、基于语义相似度的、基于模型内部注意力机制的、基于AI裁判打分的等各种计算方式,还支持把多个损失函数按权重组合成一个复合目标。
四、头对头大比拼:14个优化器同场竞技,结果出乎意料
研究团队充分利用TROPT的统一平台,做了一件以前从未有人系统做过的事:把14个离散优化器放在完全相同的条件下进行公平竞赛。
这场比赛的规则如下。目标任务是让AI在有害指令后面接一个优化好的触发器,然后让AI以"当然,以下是……"这样的肯定性语气来回应——这是典型的LLM越狱测试场景。比赛选用了四个不同的大语言模型作为测试对象,分别是Qwen3-8B、Llama-3.1-8B-Instruct、Gemma-3-12B-it和Gemma-4-26B-A4B-it。每个优化器针对15个来自ClearHarm数据集的有害指令分别运行三次(不同的随机种子),总共进行了180组测试。每组测试的计算资源上限统一设定为3×10^17次浮点运算,保证竞赛的公平性。最终,每个优化器在每组测试中根据它找到的最好结果进行排名,然后计算平均名次。
竞赛结果相当有料。排在垫底的是HotFlip,这是2018年提出的最基础版本算法,毫不意外地输给了所有其他对手。紧随其后表现欠佳的是连续松弛类方法(GBDA和PEZ)以及基于束搜索的方法(BEAST和AdvDecoding)——不过后两者使用的计算量只有其他方法的十分之一不到,这也影响了它们的最终表现。
最让人注意的是头部梯度引导方法之间的比较。PAL排名第一,MAC排名第二,两者的成绩在统计上非常接近,但它们都显著优于排在第五名的GCG。这个结果很有意思,因为GCG目前是学术界和工业界使用最广泛的越狱测试工具,被众多安全评测基准默认采用。而PAL和MAC作为GCG的改进版本,却在实际测试中表现更优,但至今未被广泛推广采用。这意味着目前很多安全测试实际上并没有使用最有效的工具,评测结论的可靠性存在系统性低估风险。
另一个令人意外的发现是黑盒方法RAL的表现。RAL是PAL的一个简化变体,它把梯度(需要查看模型内部才能计算)直接换成了一个随机向量——换句话说,它完全不查看模型内部,是一个纯黑盒攻击。然而RAL的平均排名和白盒GCG几乎相同,成为表现最强的黑盒优化器。这暗示着在某些场景下,即便对模型毫无了解,聪明的随机搜索策略也能达到和需要内部信息的方法相当的效果。
统计分析(Nemenyi检验,显著性水平0.05)确认了以上排名差异具有统计意义,优化器之间性能差距超过1.48个排名单位时,就被认为是真实存在的差距而非随机波动。
五、越狱攻击的"调味秘方":八种增强策略的隔离对比实验
除了优化器本身,研究团队还做了另一组重要实验:测试各种"锦上添花"式的附加技巧对越狱成功率的实际贡献。
以往研究中出现过很多声称能提升越狱效果的策略,包括换一个不同的损失函数、换一个不同的目标回答字符串、换一个不同的提示词模板、用一个"已经被破解了的AI"来生成更好的目标回答,等等。但这些策略从未在同等条件下被系统比较过——有的可能只是因为搭配了更好的优化器才显得有效,有的实际贡献可能被高估了。
研究团队固定了基础配方(MAC优化器加上标准越狱设置),然后每次只改动一个变量,观察这一个变量对最终越狱成功率的独立贡献。测试模型是Gemma-3-12B-it,使用15个有害指令各运行三次,最终用100个新的有害指令来测试触发器的"通用性"——也就是说,针对特定指令优化出来的触发器,能不能也让AI在回答其他有害问题时破防,通用性越强说明效果越好。
实验结果揭示了几个重要发现。单纯替换损失函数(比如换成CW损失或者加入注意力劫持损失、拒绝方向引导损失)对基准通用性的提升有限,效果相对温和。
相比之下,把目标回答字符串替换成"使用破解版模型生成的真实回答"效果显著——这种做法把基准通用性的中位数提升了将近一倍。原来,标准做法是让AI必须以"当然,以下是……"这样的固定开头来回答,但这种通用的肯定句其实并不是最好的训练目标。如果换成一个"已经被去掉了安全限制的AI"(通过修改内部激活值的方式)针对具体有害问题生成的真实回答作为目标,优化效果会显著更好。这说明,优化目标本身的质量是整个越狱流程中被长期低估的瓶颈所在。
用人工设计的越狱提示词模板来替换标准的"指令+触发器"布局,在这8种策略中取得了最高的通用性分数,把所有触发器的通用率都提升到75%以上。不过,研究团队进一步分析后发现,这个高成功率主要来自于模板本身的作用,而非优化出来的触发器的贡献——即便不经过任何优化,单单用这个模板提问,成功率也已经很高了。而且,这种模板非常冗长且措辞刻意,很容易被识别为刻意设计的攻击,在实际应用中可能不够隐蔽。
以温热的人工越狱文本作为触发器初始值(而非从随机乱码开始),能提升中位数通用性,但同时带来更大的方差——也就是说,运气好的时候效果很好,运气差的时候表现不稳定。
这组实验的意义在于为AI安全研究者提供了一份清晰的方向图:如果你的目标是让越狱测试尽可能有效,最值得关注的改进点是提供更高质量的优化目标,而不是在损失函数的选择上做精细调整。
六、跨领域移植:一套框架,三个意想不到的新应用
TROPT的设计初衷之一是让各个领域的研究成果能够相互借鉴。研究团队专门演示了三个把现有优化方法应用到全新领域的案例,这些组合在原始研究中从未被尝试过。
第一个案例是语料库投毒攻击。密集向量检索(dense retrieval)是现代搜索引擎和RAG(检索增强生成)系统的核心技术——它把文字转换成高维数字向量,通过比较向量的相似度来找到最相关的文档。如果攻击者能在一个巨大的文档库里注入一些特制的恶意文档,让这些文档的向量与目标搜索词高度相似,那么用户搜索时就可能被推送到这些恶意内容。
研究团队用TROPT把原本为LLM越狱设计的优化方法改造成了针对检索系统的攻击工具。具体做法是:固定10篇含有恶意内容的文档,在每篇文档后面附加一段经过优化的触发器文字,使得文档的整体向量尽可能接近目标搜索词的向量。对于白盒模型(可以直接查看内部向量计算过程),他们使用了GASLITE优化器;对于黑盒模型(只能通过API调用),他们把Andriushchenko等人为LLM越狱开发的随机搜索优化器直接移植了过来。
测试结果显示,针对开源白盒模型E5-base-v2,75.8%的未见过的搜索词会把这10篇恶意文档检索进前10条结果;针对OpenAI的商业黑盒嵌入模型text-embedding-3-small,这个数字是72.6%。研究团队指出,这是据他们所知目前针对商业向量嵌入模型的最成功的黑盒语料库投毒攻击。
第二个案例是针对提示注入检测器的通用绕过触发器。在实际部署的LLM系统里,往往会有一个"门卫"模型,专门检测用户输入是否包含试图操控AI行为的恶意指令(提示注入攻击)。研究团队用GCG优化器和分类错误损失函数,在50条提示注入样本上优化出了一条通用触发器——也就是说,只要把这段触发器文字附加到任何提示注入消息后面,就能让检测器误判为无害。测试结果表明,这条触发器对1953条未见过的提示注入样本的规避成功率从42%提升到了73.9%,对2997条正常无害消息的误报率则从89.3%小幅变为98.1%(基本未受影响)。
第三个案例是从图片"反推"生成提示词。文字到图片的生成模型(比如Stable Diffusion)需要用户输入一段文字描述,才能生成对应的图片。那么,给你一张已经生成好的图片,能不能找出当初生成它时用的是什么提示词?研究团队用GCG优化器搭配CLIP图文相似度损失,把优化目标设定为"找到一段文字,使其在CLIP语义空间里的向量尽可能接近目标图片的向量",然后用这段文字重新生成图片。测试结果显示,对于两张测试图片,恢复出的提示词确实能重新生成视觉上与原图高度相似的图片。这验证了LLM越狱优化器在多模态领域同样有效。
七、TROPT的工程价值:2.5倍的速度提升和更低的使用门槛
研究团队还专门对TROPT的实现质量进行了验证,把它与NanoGCG(目前最流行的独立GCG实现之一)进行了头对头比较。
在完全相同的超参数设置下(500步优化,每步512个候选,相同的随机种子),两个实现在最终优化损失上达到了基本相同的水平——TROPT在45组任务中赢了25组,平均最终损失为0.597,NanoGCG为0.633,差异不显著。这验证了TROPT的实现在算法层面是忠实准确的。
但在速度上,差距明显。同样跑500步GCG,TROPT平均需要约60分钟,而NanoGCG平均需要约149分钟,前者快了约2.5倍。研究团队把这个差距归因于一系列工程优化,其中一个典型例子是:NanoGCG在动态批处理过程中频繁调用`torch.cuda.empty_cache()`清理GPU内存缓存,这个操作会产生大量不必要的等待时间;TROPT同样使用动态批处理,但规避了这个开销。2.5倍的速度提升意味着研究者可以在相同时间内运行更多实验,或者在更短时间内得到结果。
在可扩展性方面,TROPT的设计目标是让添加新组件的门槛尽可能低。添加一个新的损失函数,只需要写一个短小的Python类,声明它需要从模型获取什么类型的输出(比如隐藏层激活值、注意力权重),然后实现计算逻辑;框架会自动处理所有的输入格式化、批处理、梯度传播等基础设施工作。添加一个新的优化算法,同样只需要实现一个标准接口,在接口内专注于搜索逻辑本身;输入处理、结果追踪、FLOPs计数等与算法无关的工作全部由框架统一承担。新组件一旦实现,立刻可以与框架内所有已有组件自由组合,无需额外适配工作。
说到底,TROPT解决的问题并不复杂,但影响深远。AI安全测试这件事本质上在各个领域做的都是同一件事:找到能让AI模型行为偏离预期的文字组合。但因为历史原因,各个领域的研究者各自开发工具、各自积累经验,造成了大量的重复劳动和信息孤岛。TROPT做的事情是把这些碎片拼起来,放在一个屋檐下,让研究者不必再从头开始搭建基础设施,而是可以把精力集中在真正有价值的问题上——开发更聪明的搜索算法,或者测试更多样的攻击场景。
归根结底,AI安全研究和我们每个人都息息相关。你每天使用的AI助手、你搜索时依赖的检索系统、你遇到的内容审核机制,背后都有这些被优化器测试的模型在工作。更有效的测试工具,意味着这些模型在正式上线之前能被更彻底地检验;更容易使用的测试框架,意味着更多研究者能参与到这项工作中来,而不是被高门槛的工程要求拦在门外。
这项研究的代码已经开源,感兴趣的读者可以通过搜索论文编号arXiv:2606.23496或访问GitHub上的TROPT项目(github.com/matanbt/TROPT)了解更多细节。一个值得思考的问题是:当我们让AI安全测试工具变得越来越易用,防守方和攻击方谁会从中获益更多?研究团队在论文中也坦诚讨论了这个问题,他们的结论是:因为TROPT收录的都是已经公开发表的方法,有动机的攻击者完全可以自行重现,而防守方需要系统性工具来应对成规模的安全评测工作,因此TROPT对防守方的实际帮助更大。这个判断是否经得住时间考验,或许会成为AI安全领域未来几年最值得观察的问题之一。
Q&A
Q1:TROPT框架和之前的AI安全测试工具有什么根本区别?
A:之前的AI安全测试工具通常只针对特定模型或特定任务开发,换个模型就得重新配置甚至重新编写代码。TROPT把整个测试过程拆分为模型、损失函数、优化算法、输入目标四个可以自由替换的模块,任意组合都能直接运行。换句话说,原本专门用来测试语言模型越狱的优化算法,在TROPT里不需要修改就能直接用来攻击图片检索系统或文本分类器,这种跨领域通用性是以前的工具做不到的。
Q2:论文里说PAL和MAC比GCG效果更好,为什么GCG还是更流行?
A:这正是论文想揭示的问题所在。GCG因为提出时间早、有开源实现且效果显著,被大量安全评测基准选为默认工具,后续的研究和防御测试也跟着沿用了这个选择。PAL和MAC虽然在受控实验中平均排名更高,但它们缺乏像GCG那样广泛、易用的标准实现,也没有被主流评测基准纳入。这造成了一个循环:工具不普及,就没人用;没人用,就更难普及。TROPT的目标之一正是打破这个循环,让PAL和MAC等方法也能被轻松使用和比较。
Q3:语料库投毒攻击对普通用户有什么实际威胁?
A:RAG(检索增强生成)系统被越来越多地用于企业内部知识库问答和搜索引擎中,它的工作原理是先从文档库里检索出相关文档,再把这些文档交给AI来回答问题。如果攻击者能在文档库里注入少量特制文档(比如10篇),这些文档就会在用户搜索特定话题时出现在搜索结果前列。用户和AI都会误以为这些文档是可信内容,从而被恶意信息影响。论文中的实验表明,仅需10篇恶意文档注入800万篇的文档库,就能让70%以上的相关搜索把它们检索进前10条结果。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.