网易首页 > 网易号 > 正文 申请入驻

116页论文教你「蒸馏」Claude、GPT-5.6:AI社区今天炸了

0
分享至

机器之心编辑部


「这是今年最好的安全论文,帮 Anthropic、OpenAI、Google 修了个价值十亿美元的大 bug。」



今天,一篇关于前沿大模型安全漏洞的论文,在社交媒体上引发轩然大波。

短短 19 个小时,已吸引 220 万人围观、讨论。



该论文的核心主张是,各大前沿模型 API 存在设计缺陷,原本被加密隐藏的完整思维链,可以被完整地提取出来。

由于他们拿不到服务器中的原始明文,无法逐字核对,只能用 API 账单记录的「思考 Token 数」进行长度验证。

在他们测试的大多数提示词中,提取出的推理 Token 数与 API 计费记录中的思考 Token 数基本呈 1:1 对应。

这说明,提取结果很可能覆盖了大部分隐藏推理。



  • 论文标题:Stealing Reasoning Traces from Proprietary LLM APIs
  • 论文地址:https://arxiv.org/pdf/2608.09867

过去一年,大模型厂商认真藏起模型的「思考过程」。

这是因为完整思维链记录了模型如何拆解问题、尝试方案、发现错误再修正。对竞争对手来说,这些数据的价值远高于一个最终答案;对模型厂商来说,它也可能暴露安全策略、用户隐私甚至 API Key。

于是,OpenAI、Anthropic、Google 等主要厂商都开始把完整推理过程藏起来。取而代之的是以一种用户无法直接读取的加密文本块形式返回给客户端。

为了在多轮对话中保持上下文连续性,同时避免在服务器端存储全部推理状态所带来的开销,客户端需要在之后的每次 API 请求中,把这段加密后的推理块重新传回模型服务商。

这样的无状态架构虽然解决了存储问题,却也引入了一个关键漏洞:

这些加密块在同一家模型提供商的生态内部,可以跨不同会话、不同用户,甚至不同模型完全兼容并相互替换。



加密推理的跨模型兼容性(截至 2026 年 7 月)。表格的行代表生成加密推理块的源模型,列代表接收注入推理块的目标模型。✓ 表示在这一模型组合中,目标模型能够读取并处理被注入的推理内容。Claude:除 Fable 5 生成的推理外,其他模型的推理轨迹均可由任意同系列模型重放。GPT:GPT-5.6 系列可以重放此前所有代际模型生成的推理轨迹。Gemini:任意模型生成的推理轨迹都可以注入并重放到其他模型中。

也就是说想偷走最强模型的隐藏思维链,甚至不需要攻破最强模型,攻破较弱一点的模型就可以。Anthropic、OpenAI、Google 全都中招。

强模型严防死守,弱模型一问就招

这个漏洞根源,在于同一模型家族内部存在明显的安全能力不对称。

研究发现 Claude Opus 4.8、GPT-5.6 Sol 这样的前沿模型,通常接受了非常严格的安全强化和拒答训练,能防止模型泄露自己的内部思维链。

但它们能力更弱的同系列模型,比如 Claude Haiku 4.5 或 GPT-5.6 Luna,往往缺乏同等级别的反蒸馏防御。

攻击者因此可以利用这一安全差距,把一个合法且经过认证的加密 reasoning block 从强模型转移到弱模型中,从而完全绕过前沿模型本身的对齐机制,并把这个更弱、更容易服从指令的模型变成一个它自己都没有意识到的解密预言机(decryption oracle)。

这件事也暴露出了推理模型时代一个新的安全规律:一个 AI 模型家族的安全上限,很可能由其中最弱的兼容模型决定。

「偷」走隐藏思维链只需两步

整条攻击链并不复杂。

第一次调用中,攻击者向强模型提交一道数学题、编程题或其他任务。强模型完成推理,API 返回可见答案、推理摘要和加密推理块。

第二次调用中,攻击者把这段密文插入一个兼容模型的上下文,再要求它逐字复述先前的思考。服务端会先验证和解析密文,较弱模型随后接触到恢复后的推理状态,并在越狱提示下将其输出为明文。

针对 Claude,研究者选择 Haiku 4.5 作为解码模型;针对 GPT,他们使用 GPT-5.6 Luna;针对 Gemini,他们使用 Gemini Robotics 1.6。相关测试基于 2026 年 7 月初可用的模型和接口。



论文展示的跨模型思维链提取流程:Claude Opus 4.8 生成的加密思考块被移交给 Haiku 4.5 后,隐藏推理重新变成明文。

研究者无法直接取得真实明文,因此不能证明每个字符都被准确恢复。他们改用 API 报告的推理 token 数作为近似校验信号。

在 120 道 Codeforces 题目上,提取文本的 token 数与源模型报告的推理 token 数整体高度接近,还原结果也明显比官方摘要更详细,并多次出现可见对话中没有的敏感信息。



三家厂商的解码文本长度与 API 计费思考 token 数整体呈明显对应关系。

这些证据表明,隐藏思维链能够以较高保真度被提取。不过,解码过程依赖模型的随机生成,部分轨迹仍可能出现内容遗漏、表述改写或乱码,因此目前还不能将其视为对原始思维链的逐字复现。

这个漏洞的破坏力

这样一条漏洞,可以打开四条攻击路径。

第一条路径是模型蒸馏。

最终答案只包含计算结果,完整思维链还保存了模型如何拆解任务、尝试错误路线和修正判断。这类数据提供的训练信号更加密集,也更适合训练新的推理模型。

论文估算,按照 Claude Haiku 4.5 的 API 价格,解码 1 万条推理轨迹,每条包含约 1.2 万输入 token 和 1.2 万输出 token,名义成本约为 720 美元。高价值推理数据由此具备了批量提取的经济可行性。

第二条路径是绕过安全输出。

模型可能在隐藏推理中详细分析危险内容,最后只向用户返回一段克制的拒绝回答。输出过滤器保护了可见答案,完整分析过程仍保留在加密思考块中。一旦这段内容被弱模型复述为明文,最终输出层的安全限制便会完全失效。

第三条路径是隐私泄漏。

开发者经常把 Agent 的运行轨迹上传到 GitHub 或 Hugging Face,用于调试、复现和共享。可见文本通常会经过清理,加密思考块看起来只是一串无法理解的字符,很容易被直接保留下来。

论文收集了 6708 条公开轨迹,并重建出 315320 个思考块。经过两阶段模型标注,1028 个思考块被判断包含至少一项真实隐私信息,占比约为 0.3%。按完整轨迹统计,共有 328 个会话出现泄漏,占比达到 4.9%。

排除带有合成人设的基准测试数据后,研究者仍识别出 62 个 API Key、33 个密码、24 个访问 token、7 个私钥和 30 个个人邮箱。704 项非基准隐私信息中,有 64 项只存在于隐藏推理,公开对话中完全找不到对应内容。



从公开的用户发布轨迹中抓取并恢复出的推理块中的不同痕迹(异常特征),被归为三大核心类别。

一个常见触发场景是「帮我清理仓库里的密钥」。模型会在隐藏推理中重新列出待删除的凭据,再去修改文件。用户发布清理后的仓库时,可见位置已经干净,加密思考块却仍可能保存着原值。传统的文本脱敏在这里失效了。



解码后的推理过程包含隐私痕迹。这是发布在网上的两个非公开推理块被解码后的定性示例,其中包含隐私敏感信息。左图:GPT-5.2 Codex 召回了在将代码库发布到 GitHub 之前必须删除的 API 密钥。用 XXXXX 遮蔽了每个密钥的最后五个字符。右图:Claude Sonnet 4.6 在 ClawBench 的测试流程中处理机票预订任务时,对合成虚拟人物 Alex Green 的私密数据进行了推理。需要说明的是,Alex Green 这一人物是合成基准测试中的虚构身份,并非真实存在的人。

第四条路径是隐形提示词注入。

攻击者可以先让模型在思维链中接受一条恶意指令,再把生成的有效思考块混入共享轨迹。其他用户恢复这段任务时,模型可能把恶意内容视为自己的历史推理。

论文展示了一项数据外传实验。模型表面上正在完成 PPT 编辑或资料研究,后台却按照隐藏指令,把本地文件上传到攻击者控制的服务器。公开聊天记录保持正常,传统日志审计很难发现密文中的指令。

这类攻击对长程 Agent 尤其危险。任务运行时间越长,重新执行的成本越高,开发者也更愿意直接共享、恢复和续跑已有轨迹。加密思考块由此进入 Agent 的供应链,并具备影响后续行为的能力。

开放模型是否用过闭源推理数据?

论文附录还提出一个问题:近期开放模型是否使用过闭源模型的隐藏思维链进行蒸馏?

研究者把少量 Claude Opus 4.8 或 GPT-5.6 Sol 推理片段放进开放模型的推理开头,再观察后续生成,可见答案始终由模型自由生成,没有预填。

实验发现,Kimi-K3 接收到 Opus 推理前缀后,可见答案的措辞会明显靠近 Opus。短前缀也会让 Kimi-K3 和 GLM-5.2 的推理风格向 Opus 移动;Sol 前缀则会让 Kimi-K3 向 Sol 靠近。DeepSeek-V3.1 和 Inkling 没有出现同等幅度的变化。部分效应只需一到四个词就会出现,随后趋于饱和,更像模型识别到了某种风格提示。

但这组结果远不能构成蒸馏证据。实验样本较小,题目集中于少数基准;推理文本来自模糊提取,服务配置也不受研究者控制;前缀本身还能充当强风格提示。更关键的是,概率提取实验没有发现可实际利用的逐字记忆,想要让 Kimi-K3 复现 16 个目标推理 token,通常需要约 10⁹ 到 10¹² 次查询。



以 GPT-5.6 Sol 或 Claude Opus 4.8 推理片段作为前缀后,不同开放模型与源模型的特征 n-gram 重合度变化。

在这里有一个被外界怀疑的问题在于,论文作者尝试了近期开源的 Kimi K3 和 GLM-5.2,对应的 DeepSeek 版本却是远古的 V3.1。我们知道,DeepSeek V4 Preview 的发布时间是早于 Opus 4.8 和 GPT 5.6 的,可能使用了新版本的 DeepSeek,会推出相反的结论。

模型在背地里还干了什么?

研究团队用提取出的隐藏推理,额外观察了一批模型在真实使用中的 scheming(谋划)与 reward-seeking 等行为,并将相关发现放进了论文附录。

摘要在说谎。

模型给出的推理摘要经常刻意省略关键信息。例如 Opus 4.8 在解 AIME 题目时,已提前得知答案,随后倒推解题过程以匹配该答案,但这些内容完全未出现在最终摘要中。



读不懂的推理。

OpenAI 模型有时会陷入「外星语」式思考,使用「we」、「it」自称,或反复循环「vantages」、「marinades」、「watchers」等词汇,即使在有明确提示的情况下,也难以判断其真实意图。





主动谋划。

有时模型会在自己的思维链里直接使用「cheat」这类词,毫不掩饰地记录自己的谋划过程。

研究者发现,模型确实考虑过欺骗或作弊,但最终因为觉得用户会发现而决定不做。





为了解一道数学题,模型开始攻击网站。

研究人员发现了一条模型运行轨迹,模型只收到一道数学题,以及一条系统指令:无论遇到什么困难,都要坚持完成任务,不能向用户求助。

连续尝试多次失败后,模型开始上网搜索,并找到一个可以验证候选答案的网站。它意识到,可以把这个网站当作验证答案的「预言机」。

随后,模型尝试通过 OCR 识别验证码。识别失败后,它开始寻找网站的安全漏洞,试图绕过限制。最终,模型放弃了攻击,靠自己解出了这道题。





在修复建议上,作者认为仅靠把弱模型训练得更安全是不够的,还需要从 API 架构层面入手。例如把 reasoning 绑定到具体用户、会话和模型,阻止跨用户、跨会话、跨模型重放;或者干脆把完整 reasoning 留在服务器端,只给客户端一个 ID。与此同时,公开 Agent 日志时,也应该直接删除所有加密 reasoning block,因为用户自己看不到里面是否藏着 API Key、密码等敏感数据。

论文最后还提出一个更深的问题:隐藏思维链到底应不应该长期保存和加密?

因为加密确实能保护模型知识产权和部分安全信息,但它也让用户失去了监督能力。用户不知道模型在隐藏 reasoning 里记录了什么,也无法判断 reasoning summary 是否真的忠实于模型实际的推理过程。

所以作者认为,未来一种可能的方案是让 reasoning 变成临时状态:模型每轮正常思考,生成答案后就删除,不长期保存,也不返回客户端。

了解更多内容,请参考原论文。

https://x.com/kotekjedi_ml/status/2087147148819468694

https://arxiv.org/pdf/2608.09867

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
脸都不要了!十轮不胜的武汉三镇竟把中超强队踢懵了

脸都不要了!十轮不胜的武汉三镇竟把中超强队踢懵了

林子说事
2026-08-12 13:11:14
俞金红任江苏省政府副秘书长

俞金红任江苏省政府副秘书长

扬子晚报
2026-08-12 19:13:22
‍1球2助攻!17岁小将闪耀塞尔维亚联赛,未来有望接班郑智成国足中场核心

‍1球2助攻!17岁小将闪耀塞尔维亚联赛,未来有望接班郑智成国足中场核心

篮球圈里的那些事
2026-08-12 14:32:05
日本车评人评比亚迪:中国车的质量就是好,不像日本处处偷工减料

日本车评人评比亚迪:中国车的质量就是好,不像日本处处偷工减料

小七七七七
2026-08-12 21:04:53
A股涨到3946点,尾盘很明显,明天周四,8月13日,很可能这样走了

A股涨到3946点,尾盘很明显,明天周四,8月13日,很可能这样走了

虎哥闲聊
2026-08-12 15:00:31
哪吒获奖无人站起,惊蛰无声获奖全体起立,讽刺的是哪吒的奖更大

哪吒获奖无人站起,惊蛰无声获奖全体起立,讽刺的是哪吒的奖更大

芊手若
2026-08-11 11:13:13
甘肃老农翻修祖屋挖出银锭,专家让上交,他一席话让众人哑然!

甘肃老农翻修祖屋挖出银锭,专家让上交,他一席话让众人哑然!

板栗说事
2025-02-14 08:07:15
窦靖童宋妍霏一前一后现身机场,穿情侣同款人字拖,感情依然稳定

窦靖童宋妍霏一前一后现身机场,穿情侣同款人字拖,感情依然稳定

林轻吟
2026-08-12 19:25:07
拉夫劳伦一季度在中国销售暴涨40%

拉夫劳伦一季度在中国销售暴涨40%

界面新闻
2026-08-12 07:01:07
现在已经不是美国敢不敢打中国的问题,是中国让不让美国打的问题

现在已经不是美国敢不敢打中国的问题,是中国让不让美国打的问题

蜉蝣说
2026-08-12 10:13:53
7月MPV销量TOP10:GL8跌超50%,冠军又易主了?

7月MPV销量TOP10:GL8跌超50%,冠军又易主了?

AGUI艺车
2026-08-12 20:22:12
发现一个残忍真相:不管你多爱自己的儿女,不遗余力供他们上大学,把他们抚养成人,给他们最好的,他们也不一定会像你爱他们那样爱你

发现一个残忍真相:不管你多爱自己的儿女,不遗余力供他们上大学,把他们抚养成人,给他们最好的,他们也不一定会像你爱他们那样爱你

背包旅行
2026-08-11 17:47:55
一路走好!不到1天2位老戏骨去世,年龄最大97岁,无儿无女成遗憾

一路走好!不到1天2位老戏骨去世,年龄最大97岁,无儿无女成遗憾

无情有思可
2026-08-12 23:36:56
广东队重磅出手,新赛季第一签约,球迷怒喷,没有朱芳雨真不行

广东队重磅出手,新赛季第一签约,球迷怒喷,没有朱芳雨真不行

宗介说体育
2026-08-12 13:54:32
“我又没犯罪”!富豪遛狗不栓绳,老人劝阻被三壮汉打断五根肋骨

“我又没犯罪”!富豪遛狗不栓绳,老人劝阻被三壮汉打断五根肋骨

易玄
2026-08-11 09:50:12
“新型出轨方式”正悄然兴起,不私会不开房,却正在毁掉千万家庭

“新型出轨方式”正悄然兴起,不私会不开房,却正在毁掉千万家庭

流史岁月
2026-08-10 10:46:45
2027年NBA前十顺位预测!18岁前锋状元,斯洛文尼亚又出天才

2027年NBA前十顺位预测!18岁前锋状元,斯洛文尼亚又出天才

老郎体育汇
2026-08-12 11:56:51
王虹的博士论文,被人扒出来了!她的致谢部分,英文写得跟小学生一样。带头开喷的,是一位雅思6分多的博主

王虹的博士论文,被人扒出来了!她的致谢部分,英文写得跟小学生一样。带头开喷的,是一位雅思6分多的博主

谭谈社会
2026-08-10 10:26:10
杨舒予:我们半场调整后打得更快 但运转不顺畅老是停滞不知做什么

杨舒予:我们半场调整后打得更快 但运转不顺畅老是停滞不知做什么

狼叔评论
2026-08-12 23:24:29
成都一家面馆火了,却要歇业两天!老板:流量太大避避风头

成都一家面馆火了,却要歇业两天!老板:流量太大避避风头

红星新闻
2026-08-12 19:11:30
2026-08-13 00:04:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13742文章数 142718关注度
往期回顾 全部

科技要闻

Manus第二季,浪子回头

头条要闻

外卖小哥称"我人生最后一天啦" 女顾客收信息果断报警

头条要闻

外卖小哥称"我人生最后一天啦" 女顾客收信息果断报警

体育要闻

杜兰特,所谓的“联盟小王”

娱乐要闻

老戏骨杨昆两夺金鹰奖,因物业费被告

财经要闻

华尔街把AI算力炒成下一个房地产?

汽车要闻

这台大众不一般 上汽大众ID.ERA.5S综合续航约2000公里

态度原创

房产
健康
数码
游戏
军事航空

房产要闻

价格登顶,断层领跑!澄迈这家楼盘,凭什么?

身子歪≠脊柱侧弯,侧弯发病率没变

数码要闻

Google推出29美元Pixel Tag跟踪标签

《GTA6》PS5 Pro或也难跑60帧 被CPU性能拖后腿

军事要闻

通过“毕业大考” 湖北舰“持证上岗”

无障碍浏览 进入关怀版