一场关于 梯度 的争吵,正在撕开当代AI最大的技术裂缝。
2026年8月2日深夜,前OpenAI工程师 Will Depue ,简历上写着Sora、o3/4o后训练,在X上写下一则判断,像一根火柴掉进了汽油桶:
"梯度是极其强大的工具,却不知为何主要只在训练时使用;测试时几乎没有显式梯度。这看起来, 完全不对 。"
Will Depue原帖:梯度如此强大,推理时却几乎消失,"totally wrong"
不到二十四小时, 图灵奖得主、AMI Labs执行董事长Yann LeCun 亲自下场,三段话,语气平静得像在念课件,信息密度却足以掀翻半个行业的默认假设。
这场对话的核心争议可以这样概括: 我们花了十年把模型训得越来越聪明,却在它展开“思考”时,把最强大的武器锁进了柜子。
一、"半脑运转":深度学习最荒诞的不对称
先把 梯度 这件事讲透
你可以把梯度想象成一种 超级灵敏的方向感 :如果我把这个参数往左拧一点点,结果会变好还是变坏、变多少?
训练阶段,整个深度学习体系就建立在这个信号之上, 反向求导 算出每个参数的梯度,优化器沿着“变好”的方向更新权重,一轮又一轮,直到模型从一团随机噪声变成能写诗、能编程、能识别肿瘤的智能体。
然后呢?
然后参数就被冻住了
模型上线,用户提问,它做一次前向计算, 把数字从左到右过一遍网络 ,吐出答案。
结束
就像一个棋手花了十年练棋,上了赛场却不许思考,只能凭第一反应落子。
Will Depue觉得这 荒谬
而他有资格这么说,他参与训练过全世界最先进的几个模型。
二、LeCun的回击:问题出在架构选择 ![]()
LeCun三段式回复:推理时优化本就是能量基模型与目标驱动AI的基础概念
LeCun的回复冷静得近乎傲慢,但每个字都在说同一件事: 你觉得不对,是因为你一直在用错误的框架思考。
三层意思,层层递进:
第一层: 推理时做优化,是 能量基模型(EBM) 与 目标驱动AI架构(ODAI) 长期使用的基础概念,早有历史。
第二层: 推断 连续 变量时(比如一条机械臂的运动轨迹),基于梯度的优化往往最合适。
第三层: 一个用世界模型预测未来、再用梯度优化来做规划的系统, 就是ODAI的好例子 。
翻译成大白话:主流语言模型像一台 自动补全机 ,给前文,预测下一个词,再用预测接着预测。
LeCun设想的 规划机 会先确定目标,在内部模拟中把方案推演到足够好,再行动。
这条思路延续自LeCun在2022年发表的立场文《A Path Towards Autonomous Machine Intelligence》, 四年来始终沿着同一条路线推进 。
![]()
早在2024年,LeCun就已在公开讲解"目标驱动AI:能量最小化推理 vs 自回归预测"
三、评论区交锋:扩散模型、蛋白质、还有一盆冷水
这条帖子下面,堪称一场 微型学术研讨会 。
第一声炮响来自扩散模型阵营
有从业者直接怼回Will Depue: "扩散模型里我们就是这么干的。"
确实,扩散模型在生成图片时,每一步去噪都在利用类似梯度的 分数信息 ,从噪声一步步走向清晰图像。
这是测试时迭代优化的 活生生的大规模案例 。
![]()
有人从样本效率角度切入:每个样本学得太少,批量更新掩盖了问题
第二声来自生物计算
有研究者指出,蛋白质设计领域 早就把“设计”写成优化问题 了,BindCraft、mosaic这些工具,把结合亲和力、稳定性、可表达性全部塞进目标函数,在推理阶段反复评估、迭代搜索。
相关工程流程已经在实验室里造出真实蛋白质。
![]()
一条"冷调"评论:Transformer其实已经在计算一种"伪能量模型"的摊销梯度
而最尖锐的一盆冷水 ,来自一位做约束优化的工程师。
他的判断极其精准: 无约束的推理时优化可以扩展,但带硬约束的推理时优化 极难扩展 。
你可以轻松写一个惩罚项让模型"尽量别撞墙",但要 保证 它绝对不撞墙?
那需要稀疏KKT分解、更高数值精度,这与当前主流GPU训练硬件的路线, 并不完全同向 。
如果ODAI真要进入工业控制和机器人领域,这个问题 绕不过去 。
四、10亿美元投入:LeCun正在把路线做成公司
LeCun的技术主张已经进入创业实践。
2025年12月, Advanced Machine Intelligence Labs(AMI Labs) 在巴黎成立,LeCun出任执行董事长。
团队阵容堪称 学术界复仇者联盟 ,CSO是Saining Xie(谢赛宁),研究与创新负责人是Pascale Fung(冯雁),世界模型副总裁Mike Rabbat……
![]()
AMI Labs官网:REAL WORLD. REAL INTELLIGENCE. 在巴黎、纽约、蒙特利尔、新加坡设有据点
2026年3月,AMI Labs完成约 10.3亿美元种子轮融资 ,投前估值约35亿美元,投资方包括Bezos Expeditions、Nvidia、Samsung。
十亿美元种子轮 本身就是鲜明表态:有人愿意拿真金白银,支持LeCun的“世界模型+梯度规划”跑出一条不同于GPT的路。
2026年6月的VivaTech上,LeCun的措辞更加鲜明: “整个行业对语言模型的执念太过狭隘。
更好的语言模型或许也是一条路,但有点 慢 。”
翻译过来就是:你们慢慢卷token吧,我要从底层换架构。
五、两种“推理时多算”走向不同方向
这里必须厘清一个极容易混淆的概念: 测试时计算(test-time compute) 。
2024年9月,OpenAI发布o1时明确表示:性能会随 更多强化学习 (训练时计算)与 更多思考时间 (测试时计算)同时提升。
后来DeepSeek-R1等推理模型把思维链、搜索、自我纠错都归入这个工具箱。
"推理时多算"已经是全行业共识
![]()
OpenAI的o1系统页面:性能随训练时计算和测试时"思考时间"双重提升
但这里有一个 关键分叉 :
主流LLM推理模型在 离散token空间 里延长思维轨迹,本质上是 用更多的文字来模拟思考 。
而LeCun主张的ODAI,是在 连续状态/动作空间 里,用世界模型预测轨迹、对目标函数做显式优化, 梯度,就是连续情形下最自然的工具 。
主流方案让模型 多说几步 来想清楚;
LeCun的方案则让模型 在内部物理模拟里演练 ,直到方案足够好。
由此,一边沿着自回归范式继续加算力,另一边转向世界模型中的轨迹优化。
LeCun自己说过类似的话:用极其昂贵的test-time compute弥补自回归架构的结构性缺陷,方向有误。 他主张把推理计算用于世界模型和目标函数上的优化。
六、1960年代的幽灵与2026年的战场
也许最值得玩味的,是LeCun自己在另一条帖子里说的一段话:
“世界模型的基本想法早已有之。1960年代最优控制里的伴随状态方法,放到今天的深度学习社区会被称作‘ 通过时间的反向求导 ’。难点在于如何把想法落到可训练、可扩展的系统。”
LeCun给出的简式:训练好的世界模型 + 最优控制 = 智能
六十年前的控制论,与今天的十亿美元创业公司,在数学上是 同一根骨头 。
当年受限于数据、算力和可学习的表征;
如今,视频自监督、多模态预训练、联合嵌入预测架构(JEPA)正在让“先学一个可规划的世界表征,再在表征里做控制”逐渐走向可行。
悬而未决的问题依然棘手: 连续空间的梯度规划,如何与语言、工具使用等离散决策混合?
目标函数由谁来写、怎么防止AI钻空子?
世界模型的预测误差在长时程规划中如何被控制?
推理时优化的算力开销,在毫秒级延迟的产品里怎么分配?
这些问题,一条推文关不掉
但这条推文做了一件事, 它让整个行业不得不正视一个事实:我们也许一直在用半个大脑跑全程比赛。
LeCun正带着10亿美元和一支顶级团队,尝试从“另外半个大脑”寻找通往通用智能的入口。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.