一年半前,DeepSeek R1 引发行业震动。一家中国实验室突然与 OpenAI 首个商用推理模型 o1 同台竞技,且据报成本远低于对手。市场一度紧张,数千亿市值数日内蒸发。
当时的实际情况比头条新闻更复杂。根据 DeepSeek 自家报告,R1 在 AIME 2024 等单项测试中超越 o1,但在事实知识(SimpleQA)等维度明显落后。后续基准测试暴露更多差距:中国模型仅在个别领域登顶,并非全面领先。
![]()
直到今年6月底,Z.ai 的 GLM-5.2 仍呈现同样模式。随后,中国最新开源权重模型密集发布:Moonshot 的 Kimi K3、阿里巴巴的 Qwen3.8-Max,以及 GLM-5.3。
差距已缩小到令投资者不安的程度
如今,中国模型在几乎所有广泛而严苛的评测中位居前列。它们处理长知识任务、多步骤编程和工具调度的可靠性,远超上一代产品。
以通用基准衡量,常被提及的"几个月差距"已缩小到足以成为投资者的问题。据《华尔街日报》报道,Anthropic 在即将进行的 IPO 前正面临棘手提问,其辩护理由是自身在顶尖层仍保持领先。而在该层级之下,市场基本属于来自中国的开放且便宜得多的模型。
投资者担忧:纯粹模型性能已几乎无法支撑一项业务。今天某个模型独有的能力,几个月后免费下载的模型也能做到。
蒸馏指控与无法防守的领先优势
目前有两项指控在发酵:中国实验室涉嫌以西方模型为"教师"进行训练,这种做法被称为蒸馏。相关证据确实存在。但有罪与否,结论相同:模型领先优势无法防守。
本期 Frontier Radar 探讨的正是:中国 AI 模型如何追平、西方实验室还能在哪里脱颖而出、行业护城河为何已经转移,以及欧洲为何同时输掉两场比赛。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.