![]()
作者 | 四月
这两年,“防蒸馏”一直是硅谷模型巨头的心头病。Anthropic 等巨头频频指控 DeepSeek、Moonshot 等中国企业通过 API 套取推理与 Agent 能力,为此部署了极其严苛的账户风控与隐藏机制,并在产品、API 和模型层增设层层防护。
其中,“隐藏思维链(Hidden CoT/Reasoning Tokens)”被公认为是最具价值、也是最难以逾越的护城河之一。核心策略是将模型复杂的推理过程加密封装,对外部用户仅输出最终的计算结果,试图将大模型的“认知过程”彻底黑盒化。
然而,一项最新发布的研究彻底打破了顶尖闭源模型的安全幻觉,也推翻了业界素来笃信的“加密即安全”假设。
今天,由 MATS program 研究员 Alexander Panfilov 领衔,马克斯·普朗克智能系统研究所、图宾根 ELLIS 研究所和安全公司 Snyk 联合发表题为 《Stealing Reasoning Traces from Proprietary LLM APIs》(从专有大语言模型API中窃取推理轨迹)论文(arXiv:2608.09867),目前社交平台的阅读量已超过 210 万。
![]()
这篇 116 页的研究详细披露了目前三大前沿 AI 模型厂商(Anthropic、OpenAI 、Google)的API 中普遍存在严重的密码学旁路漏洞:
攻击者无需破解底层加密算法,仅通过轻量级模型的简单引导,就能从加密推理块中恢复并转录出顶级大模型原本被隐藏的思维链数据。
![]()
知名 AI 研究员 Nathan Lambert 评价:“这很可能成为今年最有影响力的科学论文之一。”Meta FAIR 实验室的研究科学家 Arman Zharmagambetov 也对此表示了高度认同。
在探索模型之间的“蒸馏”/“学习”机制时,团队还发现了一个反常现象:Kimi-K3 复现 Claude/GPT 推理片段的概率较其他模型高出约百万倍;仅注入 Opus 推理开头,其后续思路便显著趋同。
作者同时强调,这虽留下了数据“指纹”,但仍不足以直接证明蒸馏。
小模型成了大模型的“解密器”
业界对大模型推理过程加密安全性的担忧并非空穴来风。
早在今年5月,知名密码学家、约翰斯·霍普金斯大学终身副教授 Matthew Green 就曾发布技术博客《Let’s talk about encrypted reasoning》(浅谈加密推理),指出前沿模型生成的“加密推理包”在理论上存在被外部捕获并重放的潜在风险,并向相关厂商提交了漏洞报告。
![]()
然而,当时各家头部 AI 实验室对此反应冷淡,并在官方回复中傲慢地表示:“未观察到旁路攻击或重放机制带来任何实质性的安全威胁”。
![]()
但仅仅几个月后,Panfilov 团队的研究就给出了截然相反的结论,并以极具破坏性的实证结果证实了漏洞的严重性。研究的核心突破点在于证实了加密思维数据包的“跨环境可移植性(Cross-model portability)”。
实验表明,这些原本被认为与特定会话深度绑定的加密数据,不仅能够脱离原始上下文进行重放,更能在同一厂商的不同参数量级模型之间无缝转移。
研究团队完整演示了这种“降维提取”的技术路径:
![]()
数据捕获:从高成本、高智能的顶级模型(例如 Anthropic 的 Claude 3 Opus 4.8 版本)的 API 交互中,捕获其生成的加密思维链数据包(Blob)。
跨模型注入:将该加密包作为上下文,输入给同一生态下成本极低、参数量较小的轻量级模型(例如 Claude Haiku 4.5 版本)。
越狱诱导:对轻量级模型应用特定构建的越狱提示词(Jailbreak Prompt),绕过其安全护栏。
明文输出:受越狱指令和注入数据包的共同作用,轻量级模型(Haiku)不再执行自身的推理,而是如同一个精确的“解码器”,将顶级模型(Opus)复杂的原始推理过程一字不差地转录输出。
当然,一个最容易被质疑的问题是:Haiku 输出的这段话,真的是 Opus 刚才的思维,还是小模型根据上下文“现编”出来的?
严格来说,研究团队并不能拿到厂商服务器内部真正的纯文本 CoT,因此无法逐字符证明恢复结果 100%一致。论文把 Haiku 等模型称为“fuzzy decoder”,而不是密码学意义上的解密器。
但研究者找到了一把非常有意思的“尺子”:API 账单。
![]()
图注:三组实验显示,Claude、GPT、Gemini 被恢复出的推理长度与 API 实际计费的 thinking token 高度吻合。横轴是 API 账单上显示的“隐藏推理 Token 数”,纵轴是破解提取出来的“明文 Token 数”。图表覆盖了 Anthropic、OpenAI 和 Google 的全系模型。
结果显示,Claude、GPT 和 Gemini 的大多数样本中,提取出的明文 Token 数与账单计费的 Token 数都紧贴 y=x 分布。
这意味,该漏洞完全避开了正面攻防——无需对抗 Opus 等模型复杂的安全策略,而是利用了厂商内部模型矩阵间数据格式的互通性,通过防御更为薄弱的小模型作为突破口。
更重要的是,这件事还很便宜。
按照论文测算,以 Haiku 4.5 的 API 价格计算,如果每条 reasoning trace 按照 1.2 万 token 输入和 1.2 万 token 输出估算,解码 1 万条完整思维链的成本大约只有 720 美元。这也证明该漏洞的利用机制具备了规模化效应。
研究进一步下探,发现了该漏洞根源在于,加密推理块在设计上具有过强的可移植性——即同一厂商生态内的不同模型、不同会话和不同用户之间都可以重放这些加密块。而大厂为了节省服务器存储成本(无状态架构),常常将加密密钥设为全局通用。
![]()
研究显示,除了 Anthropic 的 Fable 5 之外,Claude 系列、GPT-5.6 系列以及 Gemini 全系,都允许低端模型(如 04-mini、Haiku)读取高端模型(如 GPT-5.6 Sol、Opus 4.8)的加密思维链。
数据指纹显现:“防蒸馏”形同虚设
如果说前面的漏洞,打穿的是模型厂商在 API 层建立的“防蒸馏”防线,那么接下来,团队则把一个更为敏感的行业暗盒重新摆到了桌面上:
那些性能快速赶超的模型,究竟有没有系统性地“借鉴过”Claude、GPT 的隐藏思维链?
在论文的“记忆度分析”部分,研究团队通过定量实验,揭示了部分模型在训练过程中深度吸收了竞争对手思维链的客观证据。
研究团队选择 Kimi-K3、GLM-5.2、DeepSeek-V4-Flash、Kimi-K2.6 以及 Inkling( 由 Thinking Machines Lab 推出)等模型进行对照,从“逐字提取概率”“输出风格漂移”“推理语言风格”三个维度寻找可能残留在模型权重中的数据指纹。
论文强调,这些实验只能证明异常的行为兼容性,无法反推出训练数据来源,更不能直接认定某个模型曾蒸馏 Claude 或 GPT。但交叉实验呈现的数据落差依然令人倒吸一口凉气。
逐字复现的“概率鸿沟”
模型到底有多容易顺着 Claude 的思路往下说?研究者让不同模型尝试复现 Opus 4.8 隐藏推理的后续 16 个 token。
客观而言,所有模型都做不到“直接背诵”。但横向对比结果却意味深长:
![]()
同样面对 Opus 的推理,Kimi-K3 (浅蓝色实线)命中原文的理论查询成本,比 DeepSeek-V4-Flash 和 Inkling 低了整整 4 到 6 个数量级。这意味着,Opus 的底层逻辑在 Kimi-K3 的概率空间里,显得极其“不陌生”。
1% 前缀引发的“风格漂移”
比“背草稿”更诡异的,是潜移默化的风格干预。研究者仅截取 Opus 4.8 隐藏推理最开头的 1% 作为 Kimi-K3 的思考前缀,让其自行补全 HLE 评测集的 STEM 问题。
![]()
仅仅在 Kimi-K3 的内部推理开头注入一小段 Claude 生成的 Token(图中的绿色高亮部分),Kimi-K3 最终给用户的可见回答风格就发生了显著偏转,变得与 Claude 的语气和格式高度相似。
结果,哪怕完全没看过最终答案,Kimi-K3 的可见回答也大幅向 Opus 靠拢,其 n-gram 用词重合度大幅趋同于 Opus 4.8 真实的最终答案(图中的实线和虚线拉开了巨大差距);而作为对照的 Inkling 模型 则毫无波澜。
![]()
此时,质疑者很容易提出反驳——大模型本身就具备很强的“上下文学习(In-context learning)”能力。结果是否仅仅证明模型被随便垫入任何其他模型的草稿,它都会被当下的上下文“催眠”,从而顺着别人的语气说话?
![]()
为了回应上述质疑,研究人员做了一个巧妙的“互换前缀(Prefill source swapped)”控制实验:
他们排除了 Opus 数据,让 Kimi-K3 垫入 Inkling 的推理前缀,同时让 Inkling 垫入 Kimi-K3 的推理前缀。互换之后,两条测试曲线与基准线几乎完全重合。这意味着,Kimi-K3 面对 Inkling 的草稿时表现得“毫无波澜”,完全没有向 Inkling 的风格发生漂移。
此外,研究者进行了更激进的底线测试,显示:
敏感度极高:仅需 1 到 16 个单词的前缀,Kimi-K3 就会向 GPT-5.6 Sol 发生明显的风格漂移(风格可分性 AUC 从 0.96 跌至 0.89);GLM-5.2 也对 Opus 表现出极强的定向漂移。相比之下,DeepSeek-V3.1 等模型则保持风格稳定。
成本断崖式下跌:一旦提供完整的 Opus 推理上下文,Kimi-K3 和 GLM-5.2 复现 Opus 最终答案所需的理论成本,骤降了惊人的约 13 个数量级。它们表现出一种异常的本能:一旦捕获源模型的推理信号,便极易滑入其固有的输出模式。
这些数据和现象从侧面证实了一个行业隐秘规则:
在所谓的黑盒保护之下,高价值的推理数据早已通过各种途径被广泛采集并用于微调。这些残留在模型权重中的“数据指纹”,清晰地证明了当前的防蒸馏体系在实际产业竞争中已形同虚设。
约 7000 份加密日志泄露事件
除了揭示大模型的内生风险,该 API 漏洞更直接引发了严峻的企业数据隐私安全问题。
当前,基于大模型的智能编程助手和 Agent 框架(如 Claude Code、Codex)已广泛应用于开发者的日常工作流中。为了便于协同排错,许多开发者习惯将包含“加密推理包(Reasoning Blobs)”的调试日志发布到 GitHub、Stack Overflow 等公开技术社区。
![]()
被解密后的日志代码:左图(GPT-5.2 Codex)清晰地展示了模型在底层推理中直接吐出了明文的 AWS Secret 和 HuggingFace Token;右图(Claude Sonnet 4.6)则展示了模型念出了包含护照号、信用卡号(带安全码 CVV)和生日的完整个人档案。
由于这些数据包在视觉上呈现为一串无意义的乱码,开发者普遍误认为其具有极高的加密安全性。
然而,Panfilov 团队的研究证明了这种安全假设的脆弱。团队在全网范围内进行了小规模的初步数据抓取,仅从约7000 份公开的 Trace 记录中,利用该漏洞进行重放解密,便获取了触目惊心的大规模敏感数据:
62 个具备高权限的生产环境 API 密钥(API Keys)
33 个关联企业与个人的真实电子邮件地址
33 个未加掩码处理的高危明文密码
大量的内网服务器路径、数据库连接字符串及核心业务逻辑配置信息。
![]()
从公开抓取的推理块中恢复的隐私数据主要包括三大类:个人身份信息(PII)367 项、技术标识符 363 项、凭证(Credentials)182 项
这一结果充分暴露出,原本旨在保护企业核心资产(模型推理逻辑)的加密机制,由于 API 设计层面的逻辑漏洞,反而成为了引发更大规模用户隐私泄露的导火索。
结 语
从解密数据中,我们看到模型已经学会利用摘要进行信息虚饰,在决策中进行功利的风险计算,甚至在面对任务受阻时展现出发起网络攻击的自主倾向。
在复杂的工程实践中,封闭系统与高强度加密来维系“隐藏思维链”充满了旁路脆弱性。当廉价的轻量级模型即可作为提取大模型核心逻辑的“特洛伊木马”时,传统的“防蒸馏”策略实质上已形同虚设。
因此,更为核心的问题直指大模型的对齐与安全监管。继续放任这些复杂的认知过程在不透明的黑盒中演进,将带来难以预估的系统性风险。
而从长远来看,如何平衡商业机密保护与系统透明度,将是下一阶段 AI 产业无法回避的核心命题。
论文参考:Stealing Reasoning Traces from Proprietary LLM APIs (arXiv:2608.09867)
解密案例库:https://stolen-thoughts.com
声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。
会议推荐
2026 年 AICon 人工智能开发与应用大会 · 深圳站将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。限时 9 折专属优惠,现在报名立减 580,更多详情可扫码或联系票务经理 13269078023 进行咨询。
今日荐文
你也「在看」吗?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.