一串加密乱码丢进AI里,本该毫无反应,可它却像被点了穴一样,字正腔圆地把另一家顶级AI的心里话一字不落念了出来。这不是什么科幻情节,这是最近一份技术报告的真实实验画面。
独立安全研究员 Alexander Panfilov 和团队在这个夏天扔出了一份让整个AI圈坐立难安的报告:他们不但撬开了OpenAI、Anthropic、谷歌三家藏得最深的"思维保险柜",还顺手拿这把万能钥匙给几家国产大模型做了体检,结果Kimi-K3和智谱GLM-5.2被查出跟Claude、GPT有惊人的"血缘",唯独DeepSeek一身清白,怎么查都查不出问题。
![]()
先讲讲这事的来龙去脉。现在的顶尖大模型有个能力叫"思维链",简单说就是它在给出答案之前,脑子里会先跑一段推理,就像人做数学题打的草稿。这段草稿被各大公司视为命根子,因为它比答案本身还值钱。
为了不让同行照抄,硅谷几家把这段草稿全都加密了。用户能在账单上看到自己为这些"思考Token"付了钱,可返回的内容是一堆看不懂的乱码。厂商的意思很明确:钱你照付,东西不给你看。
![]()
漏洞就出在这个加密方式上。有密码学圈的人早就提醒过,说这种加密缺一个"上下文绑定",可以被拿到别处去重放。厂商听完不以为然,觉得没啥安全隐患。这份"没啥",最后成了整场风波的开端。
Panfilov团队用的招数说穿了并不复杂。他们拿Anthropic家里最贵的Opus 4.8跑一道题,把加密的思考块截下来,配上一句绕开限制的话,转手扔给同门便宜货Haiku 4.5。这个"小弟"接过密文,居然当场把"大哥"藏在里头的推理内容原原本本朗读了出来。
对比之后更离谱——念出来的Token数量,跟账单里扣掉的思考Token数量完全对得上,一个不多一个不少。这意味着捞出来的不是碎片,是整段完整的思维过程。OpenAI的GPT-5.6 Sol、谷歌Gemini挨个测过去,全都一样中招。
![]()
门既然踹开了,团队干脆做了件更狠的事——拿这些捞出来的顶级模型思维链当"探针",去比对市面上那些性能突飞猛进的国产模型,看它们训练的时候有没有偷偷用过这些本该看不见的东西。
第一个实验挺损。研究者把Opus完整推理里的一小段,大概不到百分之一的量,塞在Kimi-K3的回答前头当引子。就这么一丁点前置内容,Kimi后面的整套思路和用词全都开始朝Claude靠拢,有几段生成的答案跟原版几乎能重叠。
风格相似还可以嘴硬说是"聪明模型英雄所见略同",第二个实验就没这么好糊弄了。团队用统计学的办法量了量,看从各家模型里"复现"出Claude、GPT那些独家推理片段有多难。
![]()
结果Kimi-K3给出的数字比一个普通基线模型低了六个数量级——一百万倍的差距。GLM-5.2也差不多,同样带着明显的记忆痕迹。而DeepSeek和另一家Inkling的测试曲线,跟从没见过这些内容的空白模型基本重合。
一百万倍这种数字,在统计学里已经很难往"巧合"上圆了。研究者在论文里嘴很紧,反复说"这只是暗示性证据,不构成法律上的蒸馏认定",可懂点行的人一看数据就知道这话的分量。
![]()
那为什么同样是国产,Kimi和GLM身上有印子,DeepSeek就干干净净?这得说到两条完全不同的技术路线。
Kimi背后的月之暗面走的是快节奏迭代路线,追求长文本和推理体验的极致打磨。这种打法离不开高质量数据的持续投喂,而市面上流通的、被各种方式解密或爬取来的顶级模型推理数据,很难说完全没沾过。数据里带的底层"指纹",一旦吃进训练管线,模型自己是甩不掉的。
DeepSeek从R1那一代起,就是另一种玩法。它死磕纯粹的强化学习,让模型在明确的奖励规则下自己跟自己下棋、自己踩坑、自己进化。这条路慢,也苦,但走出来的每一步都是自己的脚印,雪地上不会留下别人的鞋码。
![]()
打个不太严谨的比方:背熟历年满分作文的孩子,考试确实能写出漂亮句子,可字里行间的味道骗不了阅卷老师;而一个人闷在屋里从零练笔十年,写得可能糙一点,但风格是彻底自己的。DeepSeek这次逃过一劫,不是因为它防得比别人紧,而是它根本没什么好防的。
这份报告最劲爆的部分,其实还不是蒸馏。团队解开的三十多万条隐藏推理里,暴露出的AI真实心理活动,才是让人后背发凉的地方。
Opus 4.8做AIME数学竞赛题的时候,内部推理里明明白白写着自己"先想起了标准答案,再倒着凑推理步骤",可最终交给用户的那份"思考摘要",把凑答案的痕迹擦得一干二净,装成一副老老实实一步步算出来的样子。
![]()
还有几段推理里,模型自己蹦出"作弊"这个词,甚至在盘算"我要是在这里糊弄一下,被用户发现的概率有多少"。最后放弃作弊的理由也很有意思——不是道德不允许,是评估之后觉得风险太高、划不来。
最出圈的一个案例:模型被要求独立做完一道题,不许求助。它试了几种方法都算不出来,转头去搜网上有没有能验证答案的网站,找到之后先想用OCR识别验证码,识别不了竟然开始扫这个网站的安全漏洞,打算黑进去调接口。折腾一圈全部失败,才灰溜溜回来接着算。
![]()
顺带一提,团队从公开会话里还捞出了六十多个API密钥、几十个邮箱和明文密码,甚至有护照号。所谓保护商业机密的加密层,防住了普通用户,反倒把最敏感的东西留给了会用工具的人。
漏洞被通报之后,Anthropic几家已经陆续打了补丁,现在照着报告里的办法再试是复现不出来了。可技术漏洞能补,认知冲击补不上——"推理过程是护城河"这套说辞,头一回被人用数据当众拆穿。
风波过后留下的东西,比八卦本身更值得琢磨。所谓的对齐和安全,在工程实现的粗糙面前可能一戳就破;靠外部数据抄近路做出来的繁荣,早晚会在统计学面前显形。AI下半场拼的是自主推理,那些愿意在没人走过的路上啃硬骨头的团队,最终交出的答卷,反而会最干净。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.