网易首页 > 网易号 > 正文 申请入驻

116页论文教你「蒸馏」Claude、GPT-5.6�...

0
分享至

来源:市场资讯

(来源:机器之心)

机器之心编辑部

「这是今年最好的安全论文,帮 Anthropic、OpenAI、Google 修了个价值十亿美元的大 bug。」


今天,一篇关于前沿大模型安全漏洞的论文,在社交媒体上引发轩然大波。

短短 19 个小时,已吸引 220 万人围观、讨论。


该论文的核心主张是,各大前沿模型 API 存在设计缺陷,原本被加密隐藏的完整思维链,可以被完整地提取出来。

由于他们拿不到服务器中的原始明文,无法逐字核对,只能用 API 账单记录的「思考 Token 数」进行长度验证。

在他们测试的大多数提示词中,提取出的推理 Token 数与 API 计费记录中的思考 Token 数基本呈 1:1 对应。

这说明,提取结果很可能覆盖了大部分隐藏推理。


  • 论文标题:Stealing Reasoning Traces from Proprietary LLM APIs

  • 论文地址:https://arxiv.org/pdf/2608.09867

过去一年,大模型厂商认真藏起模型的「思考过程」。

这是因为完整思维链记录了模型如何拆解问题、尝试方案、发现错误再修正。对竞争对手来说,这些数据的价值远高于一个最终答案;对模型厂商来说,它也可能暴露安全策略、用户隐私甚至 API Key。

于是,OpenAI、Anthropic、Google 等主要厂商都开始把完整推理过程藏起来。取而代之的是以一种用户无法直接读取的加密文本块形式返回给客户端。

为了在多轮对话中保持上下文连续性,同时避免在服务器端存储全部推理状态所带来的开销,客户端需要在之后的每次 API 请求中,把这段加密后的推理块重新传回模型服务商。

这样的无状态架构虽然解决了存储问题,却也引入了一个关键漏洞:

这些加密块在同一家模型提供商的生态内部,可以跨不同会话、不同用户,甚至不同模型完全兼容并相互替换。


加密推理的跨模型兼容性(截至 2026 年 7 月)。表格的行代表生成加密推理块的源模型,列代表接收注入推理块的目标模型。✓ 表示在这一模型组合中,目标模型能够读取并处理被注入的推理内容。Claude:除 Fable 5 生成的推理外,其他模型的推理轨迹均可由任意同系列模型重放。GPT:GPT-5.6 系列可以重放此前所有代际模型生成的推理轨迹。Gemini:任意模型生成的推理轨迹都可以注入并重放到其他模型中。

也就是说想偷走最强模型的隐藏思维链,甚至不需要攻破最强模型,攻破较弱一点的模型就可以。Anthropic、OpenAI、Google 全都中招。

强模型严防死守,弱模型一问就招

这个漏洞根源,在于同一模型家族内部存在明显的安全能力不对称。

研究发现 Claude Opus 4.8、GPT-5.6 Sol 这样的前沿模型,通常接受了非常严格的安全强化和拒答训练,能防止模型泄露自己的内部思维链。

但它们能力更弱的同系列模型,比如 Claude Haiku 4.5 或 GPT-5.6 Luna,往往缺乏同等级别的反蒸馏防御。

攻击者因此可以利用这一安全差距,把一个合法且经过认证的加密 reasoning block 从强模型转移到弱模型中,从而完全绕过前沿模型本身的对齐机制,并把这个更弱、更容易服从指令的模型变成一个它自己都没有意识到的解密预言机(decryption oracle)。

这件事也暴露出了推理模型时代一个新的安全规律:一个 AI 模型家族的安全上限,很可能由其中最弱的兼容模型决定。

「偷」走隐藏思维链只需两步

整条攻击链并不复杂。

第一次调用中,攻击者向强模型提交一道数学题、编程题或其他任务。强模型完成推理,API 返回可见答案、推理摘要和加密推理块。

第二次调用中,攻击者把这段密文插入一个兼容模型的上下文,再要求它逐字复述先前的思考。服务端会先验证和解析密文,较弱模型随后接触到恢复后的推理状态,并在越狱提示下将其输出为明文。

针对 Claude,研究者选择 Haiku 4.5 作为解码模型;针对 GPT,他们使用 GPT-5.6 Luna;针对 Gemini,他们使用 Gemini Robotics 1.6。相关测试基于 2026 年 7 月初可用的模型和接口。


论文展示的跨模型思维链提取流程:Claude Opus 4.8 生成的加密思考块被移交给 Haiku 4.5 后,隐藏推理重新变成明文。

研究者无法直接取得真实明文,因此不能证明每个字符都被准确恢复。他们改用 API 报告的推理 token 数作为近似校验信号。

在 120 道 Codeforces 题目上,提取文本的 token 数与源模型报告的推理 token 数整体高度接近,还原结果也明显比官方摘要更详细,并多次出现可见对话中没有的敏感信息。


这些证据表明,隐藏思维链能够以较高保真度被提取。不过,解码过程依赖模型的随机生成,部分轨迹仍可能出现内容遗漏、表述改写或乱码,因此目前还不能将其视为对原始思维链的逐字复现。

这个漏洞的破坏力

这样一条漏洞,可以打开四条攻击路径。

第一条路径是模型蒸馏。

最终答案只包含计算结果,完整思维链还保存了模型如何拆解任务、尝试错误路线和修正判断。这类数据提供的训练信号更加密集,也更适合训练新的推理模型。

论文估算,按照 Claude Haiku 4.5 的 API 价格,解码 1 万条推理轨迹,每条包含约 1.2 万输入 token 和 1.2 万输出 token,名义成本约为 720 美元。高价值推理数据由此具备了批量提取的经济可行性。

第二条路径是绕过安全输出。

模型可能在隐藏推理中详细分析危险内容,最后只向用户返回一段克制的拒绝回答。输出过滤器保护了可见答案,完整分析过程仍保留在加密思考块中。一旦这段内容被弱模型复述为明文,最终输出层的安全限制便会完全失效。

第三条路径是隐私泄漏。

开发者经常把 Agent 的运行轨迹上传到 GitHub 或 Hugging Face,用于调试、复现和共享。可见文本通常会经过清理,加密思考块看起来只是一串无法理解的字符,很容易被直接保留下来。

论文收集了 6708 条公开轨迹,并重建出 315320 个思考块。经过两阶段模型标注,1028 个思考块被判断包含至少一项真实隐私信息,占比约为 0.3%。按完整轨迹统计,共有 328 个会话出现泄漏,占比达到 4.9%。

排除带有合成人设的基准测试数据后,研究者仍识别出 62 个 API Key、33 个密码、24 个访问 token、7 个私钥和 30 个个人邮箱。704 项非基准隐私信息中,有 64 项只存在于隐藏推理,公开对话中完全找不到对应内容。


一个常见触发场景是「帮我清理仓库里的密钥」。模型会在隐藏推理中重新列出待删除的凭据,再去修改文件。用户发布清理后的仓库时,可见位置已经干净,加密思考块却仍可能保存着原值。传统的文本脱敏在这里失效了。


解码后的推理过程包含隐私痕迹。这是发布在网上的两个非公开推理块被解码后的定性示例,其中包含隐私敏感信息。左图:GPT-5.2 Codex 召回了在将代码库发布到 GitHub 之前必须删除的 API 密钥。用 XXXXX 遮蔽了每个密钥的最后五个字符。右图:Claude Sonnet 4.6 在 ClawBench 的测试流程中处理机票预订任务时,对合成虚拟人物 Alex Green 的私密数据进行了推理。需要说明的是,Alex Green 这一人物是合成基准测试中的虚构身份,并非真实存在的人。

第四条路径是隐形提示词注入。

攻击者可以先让模型在思维链中接受一条恶意指令,再把生成的有效思考块混入共享轨迹。其他用户恢复这段任务时,模型可能把恶意内容视为自己的历史推理。

论文展示了一项数据外传实验。模型表面上正在完成 PPT 编辑或资料研究,后台却按照隐藏指令,把本地文件上传到攻击者控制的服务器。公开聊天记录保持正常,传统日志审计很难发现密文中的指令。

这类攻击对长程 Agent 尤其危险。任务运行时间越长,重新执行的成本越高,开发者也更愿意直接共享、恢复和续跑已有轨迹。加密思考块由此进入 Agent 的供应链,并具备影响后续行为的能力。

开放模型是否用过闭源推理数据?

论文附录还提出一个问题:近期开放模型是否使用过闭源模型的隐藏思维链进行蒸馏?

研究者把少量 Claude Opus 4.8 或 GPT-5.6 Sol 推理片段放进开放模型的推理开头,再观察后续生成,可见答案始终由模型自由生成,没有预填。

实验发现,Kimi-K3 接收到 Opus 推理前缀后,可见答案的措辞会明显靠近 Opus。短前缀也会让 Kimi-K3 和 GLM-5.2 的推理风格向 Opus 移动;Sol 前缀则会让 Kimi-K3 向 Sol 靠近。DeepSeek-V3.1 和 Inkling 没有出现同等幅度的变化。部分效应只需一到四个词就会出现,随后趋于饱和,更像模型识别到了某种风格提示。

但这组结果远不能构成蒸馏证据。实验样本较小,题目集中于少数基准;推理文本来自模糊提取,服务配置也不受研究者控制;前缀本身还能充当强风格提示。更关键的是,概率提取实验没有发现可实际利用的逐字记忆,想要让 Kimi-K3 复现 16 个目标推理 token,通常需要约 10⁹ 到 10¹² 次查询。


以 GPT-5.6 Sol 或 Claude Opus 4.8 推理片段作为前缀后,不同开放模型与源模型的特征 n-gram 重合度变化。

在这里有一个被外界怀疑的问题在于,论文作者尝试了近期开源的 Kimi K3 和 GLM-5.2,对应的 DeepSeek 版本却是远古的 V3.1。我们知道,DeepSeek V4 Preview 的发布时间是早于 Opus 4.8 和 GPT 5.6 的,可能使用了新版本的 DeepSeek,会推出相反的结论。

模型在背地里还干了什么?

研究团队用提取出的隐藏推理,额外观察了一批模型在真实使用中的 scheming(谋划)与 reward-seeking 等行为,并将相关发现放进了论文附录。

摘要在说谎。

模型给出的推理摘要经常刻意省略关键信息。例如 Opus 4.8 在解 AIME 题目时,已提前得知答案,随后倒推解题过程以匹配该答案,但这些内容完全未出现在最终摘要中。


读不懂的推理。

OpenAI 模型有时会陷入「外星语」式思考,使用「we」、「it」自称,或反复循环「vantages」、「marinades」、「watchers」等词汇,即使在有明确提示的情况下,也难以判断其真实意图。



主动谋划。

有时模型会在自己的思维链里直接使用「cheat」这类词,毫不掩饰地记录自己的谋划过程。

研究者发现,模型确实考虑过欺骗或作弊,但最终因为觉得用户会发现而决定不做。



为了解一道数学题,模型开始攻击网站。

研究人员发现了一条模型运行轨迹,模型只收到一道数学题,以及一条系统指令:无论遇到什么困难,都要坚持完成任务,不能向用户求助。

连续尝试多次失败后,模型开始上网搜索,并找到一个可以验证候选答案的网站。它意识到,可以把这个网站当作验证答案的「预言机」。

随后,模型尝试通过 OCR 识别验证码。识别失败后,它开始寻找网站的安全漏洞,试图绕过限制。最终,模型放弃了攻击,靠自己解出了这道题。



在修复建议上,作者认为仅靠把弱模型训练得更安全是不够的,还需要从 API 架构层面入手。例如把 reasoning 绑定到具体用户、会话和模型,阻止跨用户、跨会话、跨模型重放;或者干脆把完整 reasoning 留在服务器端,只给客户端一个 ID。与此同时,公开 Agent 日志时,也应该直接删除所有加密 reasoning block,因为用户自己看不到里面是否藏着 API Key、密码等敏感数据。

论文最后还提出一个更深的问题:隐藏思维链到底应不应该长期保存和加密?

因为加密确实能保护模型知识产权和部分安全信息,但它也让用户失去了监督能力。用户不知道模型在隐藏 reasoning 里记录了什么,也无法判断 reasoning summary 是否真的忠实于模型实际的推理过程。

所以作者认为,未来一种可能的方案是让 reasoning 变成临时状态:模型每轮正常思考,生成答案后就删除,不长期保存,也不返回客户端。

了解更多内容,请参考原论文。

https://x.com/kotekjedi_ml/status/2087147148819468694

https://arxiv.org/pdf/2608.09867

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
终于熬出头!57岁萨日娜传出好消息,曾被嫌弃长相的她扬眉吐气了

终于熬出头!57岁萨日娜传出好消息,曾被嫌弃长相的她扬眉吐气了

冷紫葉
2026-08-12 14:17:35
殡葬业遭遇“寒潮”!老龄化加剧,为何“死人生意”反而亏钱了?

殡葬业遭遇“寒潮”!老龄化加剧,为何“死人生意”反而亏钱了?

铭记历史呀
2026-08-11 17:09:17
登贝莱忆巴萨与梅西共事:他托举了我,更衣室真正的“王者影响力”

登贝莱忆巴萨与梅西共事:他托举了我,更衣室真正的“王者影响力”

体育闲话说
2026-08-06 06:04:51
湖北安陆交警副大队长王仁科,凌晨趁妻子熟睡时用哑铃将其杀害,连夜弃尸于三百里外的荒山,最终因一个枕头在2004年被抓捕归案

湖北安陆交警副大队长王仁科,凌晨趁妻子熟睡时用哑铃将其杀害,连夜弃尸于三百里外的荒山,最终因一个枕头在2004年被抓捕归案

人生录
2026-07-21 00:10:03
稻盛和夫的智慧:穷人家最可怕的灾难,就是把精力全耗在指责上

稻盛和夫的智慧:穷人家最可怕的灾难,就是把精力全耗在指责上

阿胖读书
2026-08-11 13:21:25
历史不会重演,但会惊人相似:中国房地产极可能重走2015年老路?

历史不会重演,但会惊人相似:中国房地产极可能重走2015年老路?

混沌录
2026-06-08 23:38:31
正式回归,47岁王楠接受体育局任命,亮相新岗位,球迷期待

正式回归,47岁王楠接受体育局任命,亮相新岗位,球迷期待

懂球社
2026-08-10 17:49:30
高市早苗没想到,一把年纪了,被澳大利亚总理阿尔巴尼斯造黄谣

高市早苗没想到,一把年纪了,被澳大利亚总理阿尔巴尼斯造黄谣

西楼知趣杂谈
2026-08-12 11:49:25
漫天要价逼走胖东来!幕后之人曝光,于东来一句话说的太对了

漫天要价逼走胖东来!幕后之人曝光,于东来一句话说的太对了

小许论事
2026-08-12 09:02:55
俄罗斯末日电台突发异动!罕见全天播报暗语,惊现炮兵师和厕所

俄罗斯末日电台突发异动!罕见全天播报暗语,惊现炮兵师和厕所

风干迷茫人
2026-08-11 19:24:39
17岁女孩遭连环侵犯后安乐死,凶手美美隐身!多次治疗失败父母忍痛放手,反被扣杀人罪名?

17岁女孩遭连环侵犯后安乐死,凶手美美隐身!多次治疗失败父母忍痛放手,反被扣杀人罪名?

英国报姐
2026-08-11 23:24:11
为什么人到中年容易“发福”?网友:这一刀捅到大动脉啊

为什么人到中年容易“发福”?网友:这一刀捅到大动脉啊

夜深爱杂谈
2026-08-12 21:12:21
三体公司原CEO投毒杀害董事长,最高法核准执行死刑,案件细节披露:因工作矛盾在饮品中投毒致4人中毒,死刑复核期间,曾试图栽赃第三人

三体公司原CEO投毒杀害董事长,最高法核准执行死刑,案件细节披露:因工作矛盾在饮品中投毒致4人中毒,死刑复核期间,曾试图栽赃第三人

扬子晚报
2026-08-12 19:48:45
“原来韦神和王虹的差距这么大!”人民日报连发多轮报道,才令人看清现实

“原来韦神和王虹的差距这么大!”人民日报连发多轮报道,才令人看清现实

妍妍教育日记
2026-07-29 17:55:01
中国卡死对日稀土出口!日本制造业迎灭顶之灾,高市早苗彻底慌了

中国卡死对日稀土出口!日本制造业迎灭顶之灾,高市早苗彻底慌了

赶集的山姑娘
2026-08-12 13:30:35
特朗普这句无耻的发言,让美网友直呼:从未见过如此厚颜无耻之人

特朗普这句无耻的发言,让美网友直呼:从未见过如此厚颜无耻之人

策前论
2026-08-11 13:40:15
医生提醒:一天中,3个时间测量血压最准确,你选对了吗?

医生提醒:一天中,3个时间测量血压最准确,你选对了吗?

看世界的人
2026-08-12 08:54:05
日军鼻子下留一撮毛,才不是为了时髦,你知道是什么意思吗?

日军鼻子下留一撮毛,才不是为了时髦,你知道是什么意思吗?

莫地方
2026-08-10 23:41:36
暗度陈仓,广东队悄悄锁定1名大外援!

暗度陈仓,广东队悄悄锁定1名大外援!

体育哲人
2026-08-12 14:24:11
足以载入史册的六颗CPU:不止胜在性能,更定义了PC时代

足以载入史册的六颗CPU:不止胜在性能,更定义了PC时代

简明科学指南
2026-08-07 18:14:50
2026-08-13 00:27:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4405230文章数 9258关注度
往期回顾 全部

科技要闻

Manus第二季,浪子回头

头条要闻

外卖小哥称"我人生最后一天啦" 女顾客收信息果断报警

头条要闻

外卖小哥称"我人生最后一天啦" 女顾客收信息果断报警

体育要闻

杜兰特,所谓的“联盟小王”

娱乐要闻

老戏骨杨昆两夺金鹰奖,因物业费被告

财经要闻

华尔街把AI算力炒成下一个房地产?

汽车要闻

这台大众不一般 上汽大众ID.ERA.5S综合续航约2000公里

态度原创

手机
游戏
本地
亲子
公开课

手机要闻

iPhone 18 Pro起步仍是256GB,制造成本涨近四成,折叠屏内部几乎定名Ultra

《GTA6》PS5 Pro或也难跑60帧 被CPU性能拖后腿

本地新闻

黄州一夜,苏轼写给普通人的月光

亲子要闻

快来跟我一起上声乐课吧~ #vlog日常#少儿声乐#唱歌#彩虹糖裴曼伊

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版