一年半前,DeepSeek R1 引发行业震动。一家中国实验室突然与 OpenAI 的 o1——首个商用推理模型——同台竞技,且据称研发成本低得多。市场一度紧张,数千亿美元市值在数日内蒸发。当时关于基础设施过度建设的担忧,如今看来并非杞人忧天。
不过,当时的局面比头条新闻所呈现的更为复杂。在 DeepSeek 自己的报告中,R1 在 AIME 2024 等单项测试上超越了 o1,但在事实知识(SimpleQA)等指标上明显落后。后续的基准测试暴露了更多差距:中国模型仅在个别领域达到顶尖,而非全面领先。
![]()
转折点:最新一代开源模型
直到今年6月底,Z.ai 的 GLM-5.2 仍呈现出同样的模式。但随后发布的 Moonshot Kimi K3、阿里巴巴 Qwen3.8-Max 和 GLM-5.3 改变了局面。
如今,中国模型在几乎所有广泛且要求严苛的评测中均位居前列。它们在长知识任务、多步骤代码编写以及工具协调方面,远比前代模型可靠。
投资者视角:模型性能已难撑起商业故事
以常见基准衡量,常被提及的"几个月差距"已缩小到足以成为投资者的问题。据《华尔街日报》报道,Anthropic 在即将进行的 IPO 前面临投资者的尖锐提问,其辩护理由是在顶尖层仍保持领先。而在这一层级之下,市场基本属于来自中国的开源且价格低廉得多的模型。
投资者担心,单纯的模型性能已几乎无法支撑一项业务。今天某个模型独有的能力,几个月后一个可免费下载的模型就能实现。
目前有两项指控在讨论中:中国实验室涉嫌将西方模型作为"教师"进行蒸馏,且已有实际证据支持这一说法。但无论是否属实,结论都是一样的:模型领先优势无法被守住。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.