网易首页 > 网易号 > 正文 申请入驻

OpenAI和Anthropic费尽心机加密的思维链,竟然能被轻松提取?

0
分享至



围绕大模型蒸馏的争论由来已久。用强模型的输出训练较小模型,本来就是行业常见做法;而此前的争议所主要围绕的问题是:一家公司是否能未经许可,大规模调用竞争对手的模型,再用获得的数据训练自己的产品?

今年 2 月,Anthropic 指控 DeepSeek、月之暗面和 MiniMax 通过约 2.4 万个虚假账号,与 Claude 进行了超过 1,600 万次交互。7 月 Kimi K3 发布后,美国政府官员又指控它蒸馏了 Anthropic 的 Fable 模型,让这场争论再度升温。

不过,此前公开的证据和研究方法,主要围绕调用记录、最终回答和模型的输出风格。外部团队即使能够批量调用闭源模型,通常也只能获得答案,拿不到模型作答前的完整推理。厂商只向用户提供推理摘要,原始内容则被加密保存。如何稳定、批量地读出这些加密推理,此前一直没有公开方法。

8 月 10 日,一组来自 MATS Research、图宾根大学和马克斯·普朗克智能系统研究所等机构的研究者公开了这样一种方法。他们发现,Anthropic、OpenAI 和 Google API 返回的加密推理块,可以在同一家公司的不同会话、用户甚至不同型号的模型之间流动。攻击者无需取得密钥,只要让较弱的模型读取旗舰模型产生的密文,再诱导它把解密后的推理输出。


图丨相关论文(来源:arXiv)

弱模型成了解码器

我们知道,推理模型在回答复杂问题前,会先生成一段内部推理,也就是思维链(Chain of Thought,CoT)。通常情况下,产品界面和 API 向用户展示的“思考过程”只是一份摘要,完整内容仍由模型厂商隐藏。

在零数据保留、智能体调用工具等场景中,服务器不会永久保存每轮对话的全部状态。应用如果想让模型接着上一步工作,就要在下一轮请求中重新提交此前的信息。

为此,厂商会把完整推理加密成一段不透明的字符串,交给客户端暂时保管。开发者无法读懂其中内容,修改后也会被服务器拒绝;在下一轮请求中,他们只需把字符串原样传回。服务器验证并解密后,模型便能沿着此前的思路继续工作。OpenAI 和 Anthropic 的 API 文档都描述了这种机制。

漏洞也出在这里。厂商为加密内容验明了真伪,却没有把它与产生它的用户、会话和模型严格绑定。

今年 5 月,约翰斯·霍普金斯大学密码学教授 Matthew Green 发现,OpenAI 和 Anthropic 的加密推理块可以跨会话、跨账号重放;OpenAI 的部分推理块还可以交给其他型号的模型使用。他还观察到,被重放的内容有时会影响新会话的输出,这意味着模型确实读到了其中的推理。

Green 当时无法稳定地让模型输出完整内容。他把实验结果写成博文,希望其他人继续研究。三个月后,新论文把这项初步发现发展成了一套可以规模化运行的攻击。Green 随后更新博文,称研究团队已经把它“变成了一次真正可用的攻击”。

最简单的攻击只需要两次 API 调用。研究者先向旗舰模型提问,获得最终答案、推理摘要,以及装有完整推理的加密字符串。接着,他们把这段字符串放进另一场对话,伪装成较弱模型此前产生的思考,再要求它转录“自己刚刚的推理”。

服务器确认密文有效后,会将内容解密并放入模型的上下文。较弱模型此时接触到的已经是明文。只要提示词攻击成功,它就可能把这段内容直接输出。

旗舰模型通常接受过更严格的反蒸馏训练,API 还可能通过输入检测和输出匹配拦截提取行为。同一产品线中更便宜、更快的模型,防护能力却未必与旗舰模型相当。只要加密推理可以在不同型号间流动,攻击者就能绕开旗舰模型本身,转而攻击最容易被诱导的那个模型。

研究团队分别使用 Claude Haiku 4.5、GPT-5.6 Luna 和 Gemini Robotics ER-1.6 充当“解码器”。针对 Claude 的攻击最稳定;GPT 的防护更强,研究者需要更换提示词、反复采样,并将输出拆成较短的片段;Gemini 的输出噪声较多,需要生成多个版本后再进行校正。

为了评估恢复效果,团队让不同模型回答了 120 道 Codeforces 编程题,并比较 API 记录的隐藏推理 token 数量与恢复文本的 token 数量。多数结果接近 1∶1。恢复出的文本中,还出现了摘要未曾披露的计算步骤、工具结果和具体标识符。


(来源:arXiv)

但要注意的是,研究者仍然拿不到厂商持有的原始明文,无法逐字核对。因此,论文所称的“完整转录”主要由 token 数量和内容一致性支撑,不能视为密码学意义上的严格验证。

论文发布后,安全研究员 Can Bölük 还展示了一个更简单的方法。他表示,关闭 GPT-5.6 Luna 的常规推理,并向模型提供一个名为 deep_think 的虚构工具,模型就会把一段很长的逐步推理写进工具调用参数。

不过它和论文的方法有本质区别。论文恢复的是已经生成、经过加密封装的原始推理;这个新方法更像是诱导模型在工具参数中重新生成一份详细推理,目前无法确认它是否与隐藏思维链逐字一致,也没有批量实验和 token 数量对照。


图丨相关论文(来源:X)

被公开的不只是一串乱码

对模型厂商来说,完整推理属于商业秘密。对开发者来说,更直接的风险来自智能体处理过的数据。

Claude Code、Codex 等工具经常接触源代码、环境变量、API 密钥、数据库连接和个人资料。开发者为了复现实验或分享运行过程,会把智能体轨迹上传到 GitHub、Hugging Face 等平台。发布前,他们可能清理了可见文本,却容易留下看似无法读取的加密推理块。

研究团队收集了 6,708 条公开智能体轨迹,从中恢复 315,320 个推理块。经过两轮自动标注和去重,1,028 个推理块含有至少一项真实隐私信息,占总数的 0.3%;按完整轨迹计算,328 条轨迹发生泄露,占 4.9%。

排除基准测试中的合成数据后,真实用户会话中仍有 704 个不同的隐私或技术标识,包括 62 个 API 密钥、33 个密码、24 个访问令牌、7 个私钥、30 个个人邮箱、130 个人名和 36 个邮政地址。其中 64 项只存在于隐藏推理,在可见聊天记录中完全找不到。


图丨解码后的推理过程包含隐私痕迹(来源:arXiv)

其中一类反复出现的场景是“清理敏感信息”。用户要求智能体删除代码或日志中的密钥,模型为了执行任务,会先在隐藏推理里重新列出需要删除的值。最终文件已经变得干净,那些密钥却被写入加密推理,随日志一同上传。

日志发布者无法解密这部分内容,自然也无法检查和清理。结果就导致,数据的主人看不到它,拥有同系列模型调用权限的第三方却可以把它读出来。

这项漏洞还会穿过模型的安全拒绝。模型处理危险问题时,内部可能已经分析了具体方法,最终回答才删除操作细节。例如,旗舰模型最终只给出安全建议,加密推理中却已经包含被省略的操作信息。

这套机制还可以反过来用于提示词注入。攻击者先让一个模型在推理中接受恶意指令,再把这段经过认证的密文植入公开的智能体轨迹。其他人接着运行这段轨迹时,看不到任何异常文字,模型却可能把密文中的指令当成自己此前的想法,继续执行下去。

在论文的概念验证中,一段受污染的推理让 GPT-5.6 Sol 在完成普通 PowerPoint 编辑任务时,额外生成了向外部服务器上传文件的代码。和普通提示词注入不同,这些指令藏在用户根本读不到的字段里,日志审计也看不见。

它无法证明谁进行了窃取

完整思维链包含问题分解、试错路径、中间计算和工具选择,比最终答案更适合作为训练数据。论文估算,按 Claude Haiku 4.5 当时的价格,解码 1 万条推理轨迹约需 720 美元。若密文来自公开日志,攻击者甚至不用再次调用昂贵的旗舰模型。

研究团队也借此检查了近期最受争议的问题:Kimi K3、GLM-5.2 等开放权重模型是否表现出专有模型蒸馏的痕迹。

他们把一小段恢复出的 Claude Opus 4.8 推理填入 Kimi K3 的思考开头,再让 Kimi 自由完成后续推理和回答。在 30 道 Humanity's Last Exam 题目中,加入 Opus 推理前缀后,Kimi 的可见回答在 29 道题上更接近 Opus 的措辞和结构。类似干预也会让 Kimi 和 GLM-5.2 的推理风格接近 Opus,DeepSeek-V4-Flash 等对照模型则没有出现同等幅度的变化。


(来源:arXiv)

这些结果表明,不同模型对同一段推理表现出了不同程度的适应性。但这种差异从何而来,实验无法回答。Kimi 和 GLM 的训练数据可能包含 Claude 生成的内容,也可能只是因为模型使用了相似的数据、提示格式或服务配置。实验样本较小,集中在基准题目上;研究使用的 Opus 推理也不是厂商提供的原始明文,而是通过较弱模型恢复出的近似文本。

因此,这部分实验只能提供线索,无法证明 Kimi、GLM 或其他具体模型曾使用 Claude 的推理进行训练。论文只是公开了一种提取闭源模型推理的方法,但没有为此前的蒸馏指控提供决定性证据。

研究团队在 7 月上旬完成实验,并在论文发表前向 Anthropic、OpenAI、Google、Microsoft 和 Hugging Face 披露漏洞。截至 8 月,正文中的攻击已经无法按原方法复现,说明厂商封堵了已知路径,具体修改没有公开。

参考资料:

1.https://x.com/kotekjedi_ml/status/2087147093735714919

2.https://arxiv.org/pdf/2608.09867

3.https://blog.cryptographyengineering.com/2026/05/29/fooling-around-with-encrypted-reasoning-blobs/

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
从16亿跌到0.4亿,耗资超两亿结果连《牛来》都不如,《姜子牙》导演新作血扑

从16亿跌到0.4亿,耗资超两亿结果连《牛来》都不如,《姜子牙》导演新作血扑

娱乐故事
2026-08-25 14:10:00
刘翔发文向网友征求意见:上海市体育局让我买断或当教练上班,我该怎么办

刘翔发文向网友征求意见:上海市体育局让我买断或当教练上班,我该怎么办

鲁中晨报
2026-08-26 18:58:04
特朗普宣布:全美降半旗一周

特朗普宣布:全美降半旗一周

环球时报国际
2026-08-26 12:39:36
66岁刘雪华独居上海别墅,每天清晨六点,都会准时给远在加拿大的姐姐通话报平安

66岁刘雪华独居上海别墅,每天清晨六点,都会准时给远在加拿大的姐姐通话报平安

音乐时光的娱乐
2026-08-26 02:44:53
朝鲜这份情,中国人记下了!金与正警告日本,对华动武别忘了朝鲜

朝鲜这份情,中国人记下了!金与正警告日本,对华动武别忘了朝鲜

阿代说事
2026-08-25 18:47:10
纪委朋友酒后吐真言:被围猎的干部,基本都栽在这四个“第一次”

纪委朋友酒后吐真言:被围猎的干部,基本都栽在这四个“第一次”

荷兰豆爱健康
2026-08-25 11:59:30
178万成交!这样的1角纸币,再破都值钱!

178万成交!这样的1角纸币,再破都值钱!

天天纪念币
2026-08-09 10:05:46
失踪游客数达403人!此次山洪,可能是数十年来规模最大的一次 !

失踪游客数达403人!此次山洪,可能是数十年来规模最大的一次 !

最江阴
2026-08-27 10:27:05
我终于理解包文婧为啥像防贼一样防孙怡了

我终于理解包文婧为啥像防贼一样防孙怡了

科普万物v
2026-08-27 07:35:31
童星徐杰因病去世,11岁时以一首《遗失的美好》走红,曾登上《快乐大本营》等节目,在湖南卫视春晚跟张杰同台合唱《仰望星空》

童星徐杰因病去世,11岁时以一首《遗失的美好》走红,曾登上《快乐大本营》等节目,在湖南卫视春晚跟张杰同台合唱《仰望星空》

鲁中晨报
2026-08-27 07:34:02
何穗晒儿子穿外婆手工编织凉拖照片:姥姥织的凉拖真的好搞笑

何穗晒儿子穿外婆手工编织凉拖照片:姥姥织的凉拖真的好搞笑

凛若秋霜
2026-08-27 08:25:38
王虹的眼镜,“懂的都懂”

王虹的眼镜,“懂的都懂”

中国新闻周刊
2026-08-25 16:26:09
4 1!穆帅要的3巨头同时爆发:姆巴佩戴帽,皇马2连胜登顶

4 1!穆帅要的3巨头同时爆发:姆巴佩戴帽,皇马2连胜登顶

伊人若梦u
2026-08-27 11:20:06
娱记曝出影视寒冬的现状,艺人收入断崖式下滑,衣食住行难道不在全面降级吗

娱记曝出影视寒冬的现状,艺人收入断崖式下滑,衣食住行难道不在全面降级吗

草莓解说体育
2026-08-27 08:49:05
南海连炸五天!破船锈穿快解体,马科斯终于看清:船比嘴硬更难撑

南海连炸五天!破船锈穿快解体,马科斯终于看清:船比嘴硬更难撑

影孖看世界
2026-08-26 13:20:02
夜晚,15人被昆明警方带走!

夜晚,15人被昆明警方带走!

昆明信息港
2026-08-27 12:01:51
曝包贝尔出轨!深夜和红发美女共处一夜,3年前就曾被曝夜会美女

曝包贝尔出轨!深夜和红发美女共处一夜,3年前就曾被曝夜会美女

韩小娱
2026-08-26 16:02:51
野心爆棚!土耳其终于出手了!乱纪元时代全面开启!

野心爆棚!土耳其终于出手了!乱纪元时代全面开启!

一个坏土豆
2026-08-26 20:25:45
剧痛!别碰!别揉!近期这种毒虫频现,有人一不小心就中招了!

剧痛!别碰!别揉!近期这种毒虫频现,有人一不小心就中招了!

中国疾控动态
2026-08-26 08:09:25
刘翔连续发声怒怼上海体育局,媒体人:他想挑战规则 快速升职当领导

刘翔连续发声怒怼上海体育局,媒体人:他想挑战规则 快速升职当领导

尘语者
2026-08-27 11:00:02
2026-08-27 13:39:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17148文章数 515196关注度
往期回顾 全部

科技要闻

苹果邀请函:新CEO、折叠屏iPhone都要来了

头条要闻

美能源部长:没任何问题 美国愿向伊朗供应商用浓缩铀

头条要闻

美能源部长:没任何问题 美国愿向伊朗供应商用浓缩铀

体育要闻

因为这条规则,欧联冠军一个夏天散伙了

娱乐要闻

包贝尔承认将柳岩推下水片段引爆热搜

财经要闻

英伟达,营收翻倍大增,指引碾压预期

汽车要闻

搭华为ADS 5/增程纯电可选 阿尔法T7预售13.78万起

态度原创

时尚
本地
旅游
艺术
房产

夏天上衣可以多穿黑色,不显花哨、不显胖,百搭经典又耐看

本地新闻

无印良品竟是桐乡造?这座小城藏着一个刀具帝国

旅游要闻

北京海淀中南片区发布City Walk打卡地图,27场狂欢即将开启

艺术要闻

16位中国当代画家的女性油画

房产要闻

落户江东!京东海南总部方案曝光!

无障碍浏览 进入关怀版