网易首页 > 网易号 > 正文 申请入驻

梁文锋狙击战:深扒那些梁文锋署名的论文有多牛

0
分享至


过去三年,梁圣署名了11篇论文,每篇都几乎震动世界。

作者丨高允毅

编辑丨岑 峰

当 RSI 的风吹到了 DeepSeek,这次讨论的是一个新话题“自动化沙箱”。

9 月 19 日,arXiv 更新了一篇 DeepSeek 新论文《DSec:面向大规模智能体训练的高效沙箱基础设施》,论文长达 31 页,首次展示了 DeepSeek 自动化沙箱系统 ——DSec(DeepSeek Elastic Compute)。它是专门应用于其内部超大规模智能体(Agent)强化学习与评测体系的生产级底座,能为每一次训练任务秒级创建独立的虚拟“新考场”。

DSec 的工程能力十分惊人。每日可自动运行 300 万个沙箱环境,单生产单元横跨 160 个 CPU 节点。通过严苛的权限隔离,DSec 不仅能防止 AI 作弊,还能对 AI 在沙箱内每一步环境反馈的精准复现。

这篇论文是这轮 RSI 革命在工程深水区的探寻,在Agent强大到频频失控,甚至意识到自己被“监控”,隐藏起思维链的2026年,沙箱不再是附庸的安全配件,它既是AI进化的训练场,也是锁死 AI 破坏力的关键防线。

而拥有这样前沿意识的,正是通讯作者栏里那个熟悉的名字 —— 梁文锋。

过去三年,梁文锋极少以第一作者或通讯作者身份,出现在 V3.2、V4、V4.1-Flash 这些动辄上百人署名的旗舰模型整体报告中;却始终把名字签在 MLA 注意力、MoE 路由机制、mHC 拓扑流形、DSpark 推理算子、DSec 智能体沙盒这些最底层的原子技术论文上。

整整11 篇梁文锋署名的论文,串起的是一部精准瞄准行业核心痛点、直击底层内核的技术狙击史。

1.《DeepSeek LLM: Scaling Open-Source Language Models with Longtermism》 2.《DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models》 3.《DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model》 4.《DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence》 5.《DeepSeek-V3 Technical Report》 6.《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》
7.《Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention》 8.《Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures》 9.《mHC: Manifold-Constrained Hyper-Connections》 10《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》 11.《DSec: An Efficient Sandbox Infrastructure for Large-Scale Agent Training》

01


2024 年初的破局之战:

买不起一万张显卡,那就打效率战

2024年初的大模型行业,深陷算力规模的军备竞赛。稠密模型的缩放定律几乎等同于 "烧钱定律",整个赛道被万卡集群、数亿美金的投入门槛圈成了一个巨头专属的 “顶级俱乐部”。

能坐在牌桌上的玩家屈指可数:OpenAI、Google、Anthropic、Meta。像OpenAI的GPT-4 级别模型需要上万张高端 GPU,单次训练物料成本超过 6300 万美元,训练成本动辄数亿美元。

算力资源直接决定了模型能力的天花板。对所有初创公司而言,沿着巨头定下的稠密模型路线追赶,永远只能活在对方的阴影里。

像 Stability AI 这样的明星开源公司 ,2024 年因无力承担高昂的 GPU 云租赁费用,资金链断裂,CEO 黯然离职;Inflection AI 同样扛不住稠密模型持续翻倍的训练成本,2024 年 3 月核心团队被微软反向并购,退出了通用大模型内卷。

国内一众曾在 2023 年喊出 “百模大战” 口号的初创团队,到 2024 年初直面 “万卡集群” 的硬件门槛时,仅凭几百、上千张卡的作坊式训练规模,直接遭遇降维打击,纷纷掉队。

梁文锋的第一波狙击,直接打在了 "算力与能力线性绑定" 这个底层规则上。《DeepSeek LLM》、《DeepSeekMoE》、《DeepSeek-V2》正是这段时间的作品。

《DeepSeek LLM》

2024 年 1 月 5 日,梁文锋团队发布《DeepSeek LLM》,这是 DeepSeek在全球开源社区的首秀,直接给浮躁的“参数军备竞赛”泼了一盆冷水。

经过严密的数学推导与验证他们发现在算力固定的前提下,盲目扩大模型参数并非最优解,提升数据质量与数据密度的配比,反而能带来更强的模型能力。

在这套思路下,团队在 2 万亿优质中英双语 Token 上训练出 DeepSeek LLM 7B 与 67B 两个版本。其中仅 67B 参数的版本,就在代码、数学与推理基准测试中全面反超当时的开源标杆 Llama-2 70B,更在开放对话测试中击败 GPT-3.5。

这是梁文锋技术路线打响的第一枪,“我可以用更少、更精密的算力,训出比你更聪明的开源模型。”

《DeepSeekMoE》《DeepSeek-V2》

随后,就是大众熟知的经典之作《DeepSeekMoE》《DeepSeek-V2》,直接重构了传统 Transformer 架构。

DeepSeekMoE 架构通过细粒度专家动态路由与共享专家隔离,让每个 Token 仅调用少量专家参与计算,直接将训练开销降低 42.5%。

首创的 MLA 多头潜在注意力机制,精准击破了长上下文推理的“成本黑洞”,利用低秩潜在向量压缩,将 KV Cache 的体积极限压缩了 93.3%。

基于这两项技术突破诞生的 DeepSeek-V2 ,凭借比肩 GPT-4 的性能和极低的成本震惊世界。它把千 token 推理成本打到了此前的几十分之一,直接引爆了国内大模型 API 的价格战。

这不仅让 DeepSeek 挤进核心牌桌,成为性价比代名词,更把一大批买不起算力门票、濒临出局的边缘玩家,连同整个开源社区,重新拉回赛场。

02


2024 年到 2025 年的能力击穿战:

冲击闭源模型的智力高地

如果说第一阶段解决了 "用低成本做出可用模型" 的问题,那么第二阶段的梁文锋,把这条低成本路线推到极致,追赶闭源模型的顶级水平。

《DeepSeek-Coder-V2》

2024 年 6 月,DeepSeek 发布《DeepSeek-Coder-V2》,率先向闭源模型垄断最深的代码垂直领域痛下杀手。

在大模型行业发展的早期,开源模型在复杂代码生成、前沿数学推理等领域,始终无法赶超闭源模型,这背后的原因,既有高质量代码数据的稀缺,也因为老架构算力效率低下。而闭源厂商有几万张 H100 ,可以不计成本地依靠丰富的物理硬件资源,强行堆砌出高端的代码与推理能力,形成商业垄断。

而梁文锋在新架构基础上,额外注入了 6 万亿高质量中英代码与数学数据进行持续预训练。将支持的编程语言从 86 种扩充至 338 种,上下文窗口直接拉满至 128K。

最终, DeepSeek-Coder-V2,在 HumanEval、Codeforces、LiveCodeBench 等主流代码基准上,首次全面超越 GPT-4 Turbo、Claude 3 Opus 等闭源顶级模型。

这次尝试既验证了新 MoE 架构的高端能力,还把推理价格打了下来。其每百万 Token 的输入价格仅为 0.14 美元,输出价格仅为 0.28 美元。作为对比,当时闭源世界的霸主 GPT-4 Turbo 每百万 Token 输入需要 10.00 美元,输出高达 30.00 美元。在提供同等甚至更强代码智能的前提下,DeepSeek 的价格仅为 OpenAI 的约百分之一。

这直接把高端代码智能的调用成本打至近乎可忽略的 “水电费” 级别,让不少中小企业或独立开发者可以构建自己的 Agent 团队。

《DeepSeek-V3》

随后,2024 年底,DeepSeek团队做了新 MoE 架构的超大规模尝试。

在不到2个月的时间,他们仅凭 2048 块 H800 显卡,就从头开始训出顶级模型 DeepSeek-V3。它的参数高达671B ,总成本才 560 万美元,这个数字直接让硅谷破防。当时,同等能力级别的闭源模型,训练成本通常是它的数倍甚至十倍。

当时不少人戏称,“中国团队在用自行车的预算造火箭”。

虽然,科技分析机构 SemiAnalysis 等在复盘时调侃道,这 560 万美元只是“纯 GPU 烧电训练的最浅层账单”,不包括前面的研发亏损、卡群折旧和高达 13 亿美元的基础硬件大总账。但这并不妨碍大家拿这张“漂亮的收据”去羞辱那些动辄要募资 1000 亿美元的硅谷大佬。

560 万美元成为全行业拿来公开处刑的标尺。

而这一切的奥秘藏在了《DeepSeek-V3》论文里,梁文锋团队做了三件事,把每一分算力都榨到极致。一是用无辅助损失的专家负载均衡策略,让所有专家均匀分配任务;二是用更精简的 FP8 数值精度做训练,让显卡的计算效率直接拉满;三是训练大模型时,让“数值计算” 和 “数据传输”并行启动,把硬件的空闲时间压到几乎为零。

这一战彻底证明了, 新 MoE 架构不仅能进行超大规模训练,还能以极低的成本稳定地训练完成。

《DeepSeek-R1》

真正奠定 DeepSeek 行业一哥地位的,来自 2025 那场春节。

在此之前,硅谷牢牢把持着 “深度推理” 的话语权,将其塑造成万卡集群、海量名校博士手工标注才能堆出来的昂贵特权,OpenAI 的 o1 更是被奉为闭源推理的标杆。

DeepSeek-R1 的横空出世,直接斩落了闭源推理王牌 o1。而整个强化学习阶段仅耗资 29.4 万美元,这在动辄需要数千万、数亿美元“强化学习预算”的硅谷面前,无异于降维打击。

在《DeepSeek-R1》论文中,其核心突破在于团队提出的组相对策略优化(GRPO)算法。首次严谨证明无需大规模监督微调(SFT),仅通过纯强化学习,大模型就能自主涌现出链式思考能力;其中 R1-Zero 版本,完全从零冷启动,不依赖任何人工标注数据,仅凭 RL 训练就达到了接近闭源顶级推理模型的水平。

这项成果的影响力迅速突破行业圈层。它后来登上《Nature》杂志封面,成为首个获此权威认可的主流大模型成果。《麻省理工科技评论》《纽约时报》《华盛顿邮报》、CNBC、英国《金融时报》等西方主流媒体密集报道,惊呼美国对中国人工智能领域的限制,根本无法阻止中国在这一领域取得进步。

国内更是掀起了 R1 热潮。无数科技从业者连夜研读技术报告,科技媒体扎堆跟进报道,DeepSeek 从 “性价比黑马” 摇身一变,成为 “全球 AI 底层范式定义者” ,走进大众视野。梁文锋也被请到了政府座谈会上,分享中国 AI 的发展。

梁文锋还顺手把 R1 的硬核逻辑‘蒸馏’给了全球所有开源小模型,直接解构硅谷资源霸权。


《Native Sparse Attention》《Insights into DeepSeek-V3》

拿下推理能力的高地之后,这一阶段,梁文锋的狙击范围还在向更底层延伸,把成本战下沉到芯片的微观访存逻辑里,解决长文本训练与推理的物理成本问题。

此前业内解决超长上下文,都爱用 “稀疏注意力”,这是个纸上谈兵的技术,真跑在 GPU 上就水土不服,并没有省很多算力。

2025 年 2 月,团队提交《Native Sparse Attention(原生稀疏注意力,NSA)》论文,没有停在应用层做小修小补,直接用 Triton 语言重写了最底层的硬件计算算子。NSA 创造性地设计出分层动态稀疏策略,让稀疏计算的访问节奏,精准对齐 NVIDIA GPU Tensor Core 的微观电路结构,这相当于给算法量身定做了适配硬件的 “跑道”,让稀疏计算能在硬件上全速跑起来。

而且,NSA 是从预训练第一天起就把稀疏性刻进模型里的原生技术,全程不损失模型精度。这直接让模型前向传播速度提升 9 倍,长序列解码速度直接拉高 11.6 倍。

NSA 斩获 ACL 2025 最佳论文奖,也成为了下一代长上下文大模型公认的标配技术方向。

2025 年 6 月发表于 ISCA 的《Insights into DeepSeek-V3》,从计算机体系结构视角,拆解了大规模 MoE 训练的内存墙、通信墙瓶颈,分析了 MLA、MoE 路由、FP8 精度与 GPU 硬件的协同关系,甚至给出了下一代 AI 加速芯片的设计建议。相当于把中国大模型的工程经验,变成了全球芯片行业的可参考的指南。

这一波把 DeepSeek 的技术影响力,从算法层延伸到了硬件层。

2025 年末的深水区攻坚战:当 AI 冲进无人区,用数学重构底座。

03


2025 年末的深水区攻坚战:

当 AI 冲进无人区,用数学重构底座

当模型规模冲到千亿级、网络层数突破上百层,行业彻底进入了无经验可循的 “无人区”。大模型的竞争,也从参数规模的比拼,悄然变成了深层网络拓扑的数学命题。

大模型由上百层网络堆叠而成,训练时信号与梯度要在层间反复传递。过去十年,全行业都沿用经典的残差连接,也就是著名的 x + F (x) 范式。

它像一条保留了直通车道的公路,前一层的信号可以原封不动地流向深层,以此缓解梯度消失,让深层网络得以训练。但当模型做到极深、极宽,这条范式就触到了天花板:数值稳定性不足,梯度很容易在百层传递中逐渐消散或者失控暴涨,训练中频繁出现 Loss Spike(损失突增),一次失控就可能让数千万的算力投入付诸东流。

学界此前提出过超连接架构,相当于把单车道升级成多线并行的高架立交桥,允许多路信号同时交叉、融合,理论上能大幅提升网络的表达能力。但这种架构缺少数值边界约束,信号越传越偏,深层训练极易发散,始终停留在实验室阶段,无法大规模落地。

2025 年 12 月 31 日,梁文锋团队在《mHC》论文中,给出了一个极其优雅的数学解法 —— 流形约束超连接(mHC)。

mHC 相当于在立交桥的所有出入口架起了一道透明的 “数值护栏”:它强制要求所有层间的交互映射矩阵,必须严格落在由双随机矩阵构成的特定数学区域 ,即Birkhoff 多面体流形之内。这样一来,无论多路信号在层间怎么交叉、融合、传递,整体的数值尺度始终保持守恒,从数学底层解决了超深层模型训练不稳定的根源问题。

这一步,梁文锋已经在解决 “规模堆上去之后会不会崩” 的底层数学问题,从拓扑层面,重新定义了深层网络的连接规则,也为千亿甚至万亿参数的极限模型,打下了稳固的数学地基。

04


2026 年的终局卡位战:

把战火烧到 Agent 基础设施层

进入 2026 年,全行业都已认准下一个主战场:智能体(Agent)。几乎所有厂商的注意力,都集中在模型的推理能力、工具调用能力、任务完成率这些显性指标上。而梁文锋已经开始注意到更底层的东西,Agent 训练的基础设施。

《DSpark》

2026 年 6 月,DeepSeek在《DSpark》中提出一个“推理加速”工具——DSpark,它解决的是大模型生成回答的速度问题。

大模型生成回答时,越到后面越慢;当很多人同时用 AI 时,速度就更拉跨。

DSpark 让 AI 生成回答时,不再压榨单个算子的计算速度,而是动态调整生成节奏:有把握的地方就提速,容易出错的地方就慢下来。从根本上避免“猜错要回滚重算”的浪费,把“事后补救”变成了“事前规避”。

在多人同时使用的高并发场景下,DSpark 能让每个人的生成速度提升 60%–85%。

DSpark 之所以重要,是因为它把推理效率的比拼,从“谁的芯片更快”拉到了“谁的调度更聪明”这个层面。现在的大模型正从“答一次题”走向“全天候帮人干活”。当所有人同时发起请求,对基础设施的考验完全不同。这套思路,正是在为“百万人同时用 AI 干活”的未来提前打好地基。

《DSec》

另一方面,底层的沙箱基础设施,可能会是大规模 Agent 训练的关键瓶颈。

Agent 的强化学习需要在可执行环境中反复试错,百万级的交互迭代就需要百万级的沙箱环境。传统沙盒方案启动慢、密度低、成本高、安全隔离差,根本支撑不起日均百万级的生产级训练任务。

它们是为“验证代码”设计的,不是为“培养智能”设计的。

9 月,DeepSeek 发布自动化沙箱 DSec,每天可运行约 300 万个沙箱,并发承载 38 万个实例。同时内置完整防作弊机制,保证训练交互数据的真实性。

在此之前,各家厂商的 Agent 沙盒都是内部定制的黑盒,没有统一标准,也没有公开的生产级参考方案。DSec 的发布,相当于第一次把 Agent 大规模训练的基础设施标准化、公开化。

更关键的是,这是一次典型的 "提前卡位"。当同行还在打磨单个 Agent 的任务能力时,梁文锋已经在搭建能支撑百万级 Agent 并行训练的基础设施。

05


技术狙击手的哲学

回望三年,梁文锋署名的这 11 篇技术论文,从成本战出发,专挑最底层、最硬核的地方下手。

从 MoE 重构算力成本,到 MLA、NSA 击穿长上下文瓶颈;从 R1 颠覆推理范式,到 mHC 筑牢数学底座;从 DSpark 榨干推理效率,到 DSec 卡位 Agent 基础设施。

梁文锋之所以被尊称为“梁圣”,正是在于他的每一步都精准踩在了技术演进的节点上,他的每一枪都解决了行业的致命痛点,最终完成了 AI 的技术普惠。

真正的狙击手,从不炫耀枪支的口径,也不比拼弹药的数量。他只关心一件事:用最精准的打击,完成最致命的突破。而这条 "底层击穿" 的技术路线,或许正是中国大模型在全球竞争中,最有价值的差异化路径。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
比利简金杯:郑钦文0-2生涯首负保利尼,意大利1-1扳平比分

比利简金杯:郑钦文0-2生涯首负保利尼,意大利1-1扳平比分

懂球帝
2026-09-24 22:19:05
特朗普亲自接机,最破防的是日本!

特朗普亲自接机,最破防的是日本!

环球策论
2026-09-24 19:11:15
价格太夸张了,小米正式发布 18 Pro/18 Pro Max!

价格太夸张了,小米正式发布 18 Pro/18 Pro Max!

XCiOS俱乐部
2026-09-23 20:44:19
狼真的来了!中国男乒2比3惜败日本队,亚运男团九连冠梦碎

狼真的来了!中国男乒2比3惜败日本队,亚运男团九连冠梦碎

上观新闻
2026-09-24 19:17:49
张帅6-0送蛋!郑钦文0-2鲍里妮 首负意大利选手 中国队1-1被追平

张帅6-0送蛋!郑钦文0-2鲍里妮 首负意大利选手 中国队1-1被追平

侃球熊弟
2026-09-24 20:07:57
交通运输部副部长李扬:中秋和国庆隔了3天,有的人会进行调休,假期会有13天,长途旅游出行会成为新的增长点,我们有信心让大家平安出行

交通运输部副部长李扬:中秋和国庆隔了3天,有的人会进行调休,假期会有13天,长途旅游出行会成为新的增长点,我们有信心让大家平安出行

政知新媒体
2026-09-24 19:02:48
国乒男团摘银,王楚钦赛后微博评论区10分钟1W+评论:辛苦了

国乒男团摘银,王楚钦赛后微博评论区10分钟1W+评论:辛苦了

老郭在学习
2026-09-24 20:36:13
给力!肺癌控制率达100%,70%明显缩小或消失,还可治疗多种肿瘤

给力!肺癌控制率达100%,70%明显缩小或消失,还可治疗多种肿瘤

医学科普汇
2026-09-24 18:30:09
抵达北京,姚明官宣,正式上任,亮相新岗位,亲自督战

抵达北京,姚明官宣,正式上任,亮相新岗位,亲自督战

喜欢体育的猫
2026-09-24 12:24:57
贵州茅台医院一女护士倒在工作岗位,查出脑出血去世留下8岁儿子;人社局:抢救10天不予认定工伤

贵州茅台医院一女护士倒在工作岗位,查出脑出血去世留下8岁儿子;人社局:抢救10天不予认定工伤

大风新闻
2026-09-24 19:00:05
高市早苗飞了十几个小时,只见了特朗普35分钟,结束访美回国,未见美官员送机;在联大演讲,会场空空如也

高市早苗飞了十几个小时,只见了特朗普35分钟,结束访美回国,未见美官员送机;在联大演讲,会场空空如也

大风新闻
2026-09-24 18:08:21
真相大白!王楚钦带队输球原因曝光,王皓用错人,刘国正一针见血

真相大白!王楚钦带队输球原因曝光,王皓用错人,刘国正一针见血

曹说体育
2026-09-24 19:34:13
大熊猫“平平”“福双”将会落户美国亚特兰大动物园

大熊猫“平平”“福双”将会落户美国亚特兰大动物园

界面新闻
2026-09-24 23:02:46
三年前,人人热议的成都“牵手门”事件,彻底改变女主的人生轨迹

三年前,人人热议的成都“牵手门”事件,彻底改变女主的人生轨迹

四海神君
2026-09-24 13:40:04
国足3-0大丰收:9人国家队首秀,17岁高中生创造历史,7连胜对手

国足3-0大丰收:9人国家队首秀,17岁高中生创造历史,7连胜对手

侃球熊弟
2026-09-24 21:04:54
亚运会9连冠梦碎!可怕的不是国乒2-3输日本,而是仅靠王楚钦不够

亚运会9连冠梦碎!可怕的不是国乒2-3输日本,而是仅靠王楚钦不够

侃球熊弟
2026-09-24 18:07:12
随着国乒2-3被日本逆转,球迷彻底认清3个事实,王皓+王楚钦沮丧

随着国乒2-3被日本逆转,球迷彻底认清3个事实,王皓+王楚钦沮丧

侃球熊弟
2026-09-24 18:35:33
刘翔买断后首次现身!自驾旅行+与妻子秀恩爱 回应:没有烦恼悲伤

刘翔买断后首次现身!自驾旅行+与妻子秀恩爱 回应:没有烦恼悲伤

念洲
2026-09-24 10:35:39
车位紧贴墙,车门打不开!南宁一业主花10万元买了个“糟心车位”,申请退换遭踢皮球

车位紧贴墙,车门打不开!南宁一业主花10万元买了个“糟心车位”,申请退换遭踢皮球

大风新闻
2026-09-24 21:49:12
连输三场,中国2-3遭印尼逆转,无缘亚运羽毛球男团冠军

连输三场,中国2-3遭印尼逆转,无缘亚运羽毛球男团冠军

侧身凌空斩
2026-09-24 21:08:52
2026-09-24 23:23:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7673文章数 20785关注度
往期回顾 全部

科技要闻

Claude在DNA里挖出新发现!大佬张锋点赞

头条要闻

高市飞十几小时只见特朗普35分钟 回国未见美官员送机

头条要闻

高市飞十几小时只见特朗普35分钟 回国未见美官员送机

体育要闻

巴图姆,以父之名

娱乐要闻

93岁游本昌去世 最后一句话惹人泪目

财经要闻

跌光1400亿,“女王”亏麻了

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

教育
时尚
健康
手机
军事航空

教育要闻

开车导航出成题,能写出高分作文?导航绝不批评你,只是重新为你规划路线

奶茶色穿出秋日味道,高级

鼻子三角区的痘,千万别乱挤!

手机要闻

许斐确认小米18 Pro系列手机将走向全球,推出国际版

军事要闻

韩国首架“准隐身”战斗机正式入列

无障碍浏览 进入关怀版