西大发难:
东大AI大模型蒸馏,事关国家安全!
2026年9月8日:西大国家安全局(NSA)、网络安全与基础设施安全局(CISA)以及联邦调查局(FBI)联合公布网络安全通告:
![]()
通告指控:东大六大AI公司恶意复制西大AI公司的技术,包括——
深度求索(DeepSeek)
月之暗面(Moonshot AI)
阿里巴巴
稀宇极致(MiniMax)
阶跃星辰(StepFun)
智谱
兵器迷注:
美方所称的蒸馏技术,在业内被公认——美国AI行业也公认——为AI研究领域一种合法且有用的技术,通过规模更大、成本更高的AI模型的输出来训练较小模型,以降低训练新AI工具的成本。这属于大模型压缩技术的一种。
![]()
大模型压缩技术,是指在尽可能保持精度的前提下,通过技术手段压缩模型、加速推理计算,从而降低AI模型的大小和推理延迟。主要的大模型压缩技术,分为量化、剪枝、知识蒸馏、低秩分解四大路径。
![]()
量化:即降低权重与激活值精度减少模型体积与计算量。
剪枝:通过去除冗余参数减少计算量。
知识蒸馏:利用教师模型指导学生模型(学生)训练,传递软标签、特征或注意力分布。(Anthropic Claude Mini将模型缩至1/10大小仍保留85%以上性能)。在具体应用上,就是通过API接口,向教师模型发起海量请求,收集模型的输出逻辑、推理路径、答案分布、思维链等核心信息,再用这些数据反向训练自己的模型。
![]()
注意:这些请求,有合规或非常规之分。
低秩分解:将大矩阵分解为低秩子矩阵,减少参数与计算。
回到外媒——
通告指出:
1东大的AI企业正在通过“大规模、工业化、规模化”的知识蒸馏行动,对西大AI企业模型中的专有功能和受限使用能力,进行系统性地提取。
2 相关行动,构成东大企业AI发展战略的核心,而非仅是正常的补充手段。
3 这是一种” 激进、恶意且具有针对性的蒸馏活动”。
![]()
通告指出:
东大 政府在可能知情的情况下,DeepSeek等六家东大企业,至少自2024年底以来,就从西大前沿AI模型中提取数十亿个词元,涉及数百万次交互/请求,其中包括Claude、GPT、Gemini和Grok的不同版本。
这种大规模蒸馏,不仅降低了东大AI公司的研发成本,还”增强东大的军事和网络攻击能力”,在安全方面,这些能力可能会被用于针对西大及其盟友。
兵器迷注:
蒸馏行为,可以让学生模型的研发成本,降低90%以上,模型落地周期从1-2年缩短至3-6个月。
![]()
OpenAI、Anthropic、谷歌牵头的全球AI联盟,目标就是限制模型蒸馏行为——计划通过技术水印、请求风控、行为溯源、跨平台数据共享等手段,全面限制、封堵其他外部公司针对自身模型的蒸馏提取。
同时 ,该联盟正在推动全球范围内的技术产权界定,将非法蒸馏纳入技术窃取范畴。
西大国家安全局为首的机构建议,西大AI企业实施全面的检测和缓解措施,检测异常和恶意的提示词、账户、网络及行为,部署有针对性的响应调整,建立跨机构的情报共享机制,对来自不同模型提供商、云平台和API聚合商的活动进行关联分析,以识别分散实施的知识“蒸馏”行动。
蒸馏教师模型,无可厚非。但是如果学生模型 没有自己的底层技术,即独立的数据体系和可控的模型架构,完全、或基本依赖蒸馏教师模型,那么一旦蒸馏请求的API被教师关闭,技术迭代立刻陷入死胡同,至少也是从高铁降速为绿皮车了。
因此,即便要利用蒸馏,也要“自研基础,蒸馏提速”,才是长远可行的学生模型发展之路。而东大的AI大模型,发展成熟到一定阶段,还是要走自研全栈大模型的路数。 智谱结合阶跃星辰的自研架构,相对比较扎实;MiniMax和DeepSeek,也已经逐步告别了“蒸馏时代”,走向全自研道路。
蒸馏捷径原无错
自研基础须本真
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.