网易首页 > 网易号 > 正文 申请入驻

深度学习的数学原理

0
分享至

来源:市场资讯

(来源:图灵人工智能)

单击上方“图灵人工智能”,选择“星标”公众号

您想知道的人工智能干货,第一时间送达


转自见色非色,仅用于学术分享,如有侵权留言删除

2012年,AlexNet 在 ImageNet 上以六千万个参数碾压对手。但一个基础问题始终悬而未决:为什么简单的梯度下降,能在非凸、高维、布满鞍点的损失 landscape 中找到有效解?答案不是某一条定理,而是一整套数学工具的精密协同——线性代数、微积分、概率论、信息论、优化理论、泛化理论、几何学,它们像一支交响乐团,共同奏出深度学习的乐章。

一、从一个训练日志说起

2012年秋天,多伦多大学一间地下室里,Alex Krizhevsky 盯着屏幕上跳动的数字,手指悬在键盘上方,随时准备按下终止键。

八个 NVIDIA GTX 580 GPU 在机柜里轰鸣,散热风扇的噪音像一群困在金属笼子里的蜜蜂。ImageNet 的一百二十万张图片正在模型中流转——猫、狗、飞机、蘑菇、火山、婚纱、灯塔——每一张都被压缩成 150,528 个数字,灌进一个叫做 AlexNet 的神经网络。

训练日志在终端上滚动:

Epoch 1,损失 6.9。

Epoch 10,损失 2.3。

Epoch 40,损失 0.8。

验证集上的 top-5 错误率最终停在了 15.3%。Krizhevsky 靠在椅背上。上一年的 ImageNet 冠军,用了更复杂的传统视觉方法,错误率是 26.2%。这个差距不是渐进式的改良,而是一记耳光——打在所有认为"神经网络已经死了"的人脸上。


AlexNet 网络架构:5 个卷积层 + 3 个全连接层,共 6000 万参数

来源:Medium / Abhishek Jain

但如果我们暂停在这串数字背后,问一个更基础的问题,事情就变得有趣了。

AlexNet 有六千万个参数。它的损失函数——一个关于这六千万个变量的高维曲面——既不是凸的,也不是光滑的。理论上,这个曲面布满了鞍点、局部极小值和狭长峡谷。按照传统优化理论,在这样一个曲面上用简单的梯度下降寻找全局最优,无异于在暴风雪中的喜马拉雅山脉寻找最低点,而且你只有一根蜡烛照明。

核心困惑

可它偏偏就找到了。不是勉强可用,而是碾压式的胜利。此后十年,从 ResNet 到 Transformer,从 GPT 到 AlphaFold,同样的故事反复上演:简单的随机梯度下降,在数以亿计的参数上,总能找到让模型表现惊人的那组数值。就像一把生锈的钥匙,居然能打开每一扇金库的大门。

这不是魔法。这是数学。本文要回答的核心问题是:这套数学体系究竟是如何让深度学习成为可能的?

二、线性代数:在高维空间里重新安放数据

2.1 从像素到向量:一场坐标系的革命

想象你是一位外星人,第一次来到地球。有人给你看一张猫的照片,问你:"这是什么?"

你看到的不是猫。你看到的是 150,528 个数字——每个像素的红色、绿色、蓝色强度。在 224×224 的网格上,这些数字构成了一幅复杂的光谱地形图。猫的耳朵、胡须、瞳孔,都隐藏在这些数字的起伏中。

问题是:这个坐标系对"识别猫"这个任务毫无意义。

在像素坐标系里,两张猫的照片可能相距遥远——一张在白天拍摄,一张在夜晚;一张正面,一张侧面。像素值的差异可能大到像是完全不同的东西。与此同时,一只白猫和一只白狗在像素空间里可能靠得很近,因为它们的毛色相似。

深度学习做的第一件事,是推翻这个坐标系。

一个全连接层的计算,表面上是矩阵乘法加上偏置:h = Wx + b。但矩阵乘法在这里不是"计算",而是政变。权重矩阵 W 的每一行,都是在高维空间里选定的一个新方向。输入向量 x 与 W 的每一行做内积,相当于测量 x 在多少个"有意义"的方向上有投影。

偏置 b 则负责平移,让决策边界不必经过原点——就像把一把刀从桌子边缘移到食物上方。

但这只是计算层面的描述。真正重要的是:这些线性变换在做什么?

它们在做坐标变换。原始像素坐标系是"物理的"——每个维度对应一个像素位置。深度学习通过一层又一层的线性变换,把数据从物理坐标系,逐步映射到"语义坐标系"。在语义坐标系里,相近的向量代表相近的概念。猫的图片彼此靠近,狗的图片聚成另一团,而猫狗之间的边界变得清晰。

这个过程的数学本质,是寻找一组新的基向量,使得数据在新坐标系下的表示具有"好的性质"——比如稀疏性、线性可分性、或语义相似性。PCA(主成分分析)做的是同样的事,但 PCA 是线性的、无监督的。深度网络则是非线性的、有监督的,它学到的坐标系直接服务于下游任务。

换句话说,PCA 像是一个自动整理书架的图书管理员,按书的大小排列。深度网络则像是一个读过所有书的编辑,按主题、风格、时代重新排列——而且知道你想找什么。

2.2 张量:批量数据的语言

深度学习中很少处理单个向量,而是批量处理。一百张图片同时进入网络,形成一个 (100, 150528)的张量。卷积层更进一步,它用四维张量 (batch, height, width, channels)来组织数据。

张量运算的美妙之处在于,它让并行计算成为可能。GPU 的架构就是为这种大规模并行矩阵运算设计的。没有线性代数提供的张量语言,深度学习的计算效率将大打折扣——训练一个模型可能需要几个月而不是几天。

更深层地看,张量结构反映了数据的固有组织方式。一张图片的空间局部性(相邻像素相关)被编码在 height 和 width 维度;通道维度(channels)则对应不同的特征图。卷积操作利用这种结构,通过共享权重(同一个卷积核在图片不同位置滑动)大幅减少了参数量。

这种"权重共享"的数学思想,本质上是对数据平移不变性的编码——猫无论在图片左上角还是右下角,都应该被识别为猫。这是线性代数在偷偷告诉我们:世界有对称性,而好的模型应该尊重这种对称性。

2.3 特征值与奇异值:网络在"看"什么

如果我们深入一个训练好的网络的权重矩阵,会发现一些有趣的模式。对权重矩阵做奇异值分解(SVD),大的奇异值对应的方向,往往是网络认为"重要"的特征方向。小的奇异值则对应噪声或冗余信息。

这给了我们一个观察网络内部运作的窗口:网络不是在随机地扭曲空间,而是在有选择地放大某些方向、压缩另一些方向。这种选择性,正是从数据中学到的。

神经崩溃现象

在训练充分的分类网络中,同一类别的最后一层特征会坍缩到一个点,不同类别的特征点则构成一个等角紧框架(Equiangular Tight Frame)。这意味着网络在最后一层把数据组织成了高度规则的几何结构——这种结构不是人为设计的,而是优化过程的自发产物。

想象一下:网络在训练结束时,把一万张猫的照片在最后一层压缩成了一个点。不是近似,是数学意义上的坍缩。而猫点、狗点、鸟点之间的距离,精确地相等。这是几何的秩序,从混沌中自发涌现的秩序。

三、微积分:反向传播与链式法则的精密舞蹈

3.1 从有限差分到链式法则:一场计算效率的革命

训练神经网络的核心问题,是计算损失函数对每一个参数的偏导数。一个有一亿参数的网络,就需要计算一亿个偏导数。

最朴素的方法是有限差分法:把某个参数微调一点点,看损失变化多少。这需要做一亿次前向传播——计算上完全不可行。即使每次前向传播只需要一毫秒,计算所有参数的梯度也需要近三万个小时。也就是说,训练一个模型需要三年多,而不是几个小时。

1986年,Rumelhart、Hinton 和 Williams 重新发现了反向传播算法。它的核心思想极其优雅,优雅到让人怀疑为什么之前没有人想到:利用微积分的链式法则,把梯度从输出层逐层"传回"输入层。

链式法则

假设损失函数 L 依赖于参数 w,而 w 通过中间变量 z 影响 L:

∂L/∂w = (∂L/∂z) · (∂z/∂w)

反向传播的关键洞察是:计算 ∂L/∂z 时,如果 z 是某一层所有神经元共享的下游变量,那么这个梯度只需要计算一次,就可以供该层所有参数使用。这种复用机制,把计算复杂度从指数级降到了线性级。


反向传播:梯度从输出层逐层传回输入层,误差信号在各层间反向流动

来源:GeeksforGeeks

从三年到几小时,这就是数学的力量。不是近似,不是取巧,而是发现了一个连乘结构中的冗余,并把它消除。

3.2 计算图:自动微分的基石

现代深度学习框架(如 PyTorch 和 TensorFlow)把反向传播封装在自动微分系统


3.3 梯度消失与梯度爆炸:深度网络的阿喀琉斯之踵

链式法则在带来效率的同时,也引入了一个深层问题。

考虑一个深度网络,第 l 层的梯度需要通过后面所有层的链式法则传递回来。如果每一层局部梯度的绝对值都略小于 1,比如 0.8,那么经过 20 层之后,梯度会衰减到 0.8²⁰ ≈ 0.01。前面的层几乎得不到任何更新信号——这就是梯度消失。

反过来,如果局部梯度略大于 1,比如 1.2,经过 20 层之后梯度会爆炸到 1.2²⁰ ≈ 38。参数更新会变得极不稳定——这就是梯度爆炸。

梯度消失

局部梯度 < 1,经过多层连乘后梯度指数衰减。sigmoid 和 tanh 在输入较大时梯度接近零,加剧了这一问题。

梯度爆炸

局部梯度 > 1,经过多层连乘后梯度指数增长。参数更新变得极不稳定,训练发散。

这个问题的数学根源在于链式法则的连乘结构。sigmoid 和 tanh 激活函数在输入较大时梯度接近零,加剧了梯度消失。你可以想象 sigmoid 函数在两端像两条水平的铁轨——火车(梯度)到了这里就停了,哪里也去不了。


四、概率与信息论:为什么交叉熵是分类问题的自然语言


克劳德·香农(Claude Shannon, 1916–2001),信息论之父

来源:The New Yorker

4.1 从熵到不确定性:香农的洞见

1948年,克劳德·香农在贝尔实验室的走廊里踱步。他刚刚完成了一篇论文,题目平淡无奇:《通信的数学理论》。但他知道,这篇论文将改变一切。

在论文中,香农定义了一个革命性的概念:熵。一个随机变量的熵,衡量的是它的不确定性。


4.2 交叉熵:用错编码的代价

深度学习中的分类问题,本质上是在估计一个概率分布。模型输出一个概率向量 q = (0.1, 0.7, 0.2),表示"这张图片 10% 是猫,70% 是狗,20% 是鸟"。真实标签是一个 one-hot 向量 p = (0, 1, 0)——它确实是狗。

交叉熵 H(p, q) = −Σ p(x) log q(x)衡量的是:如果你用模型估计的分布 q 来编码真实分布 p 的事件,平均需要多少比特。在这个例子中,H(p, q) = -log(0.7) ≈ 0.36 比特。如果模型很自信但错了,比如 q = (0.9, 0.05, 0.05),交叉熵就会飙升到 -log(0.05) ≈ 4.32 比特。

关键等价关系


4.3 最大似然的另一面


五、优化理论:非凸 landscape 中的奇迹


神经网络的高维损失 landscape:布满山谷、鞍点和高原的复杂地形

来源:Medium / Tobias Roeschl

5.1 梯度下降的数学保证:理想与现实的鸿沟


这意味着,我们理论上找不到全局最优。我们甚至不知道全局最优在哪里。但深度学习似乎并不在意这个理论上的"不可能"。

5.2 SGD 的隐式正则化:噪声的馈赠

然而实践表明,SGD(随机梯度下降)在深度神经网络上表现得异常好。不仅收敛快,找到的解还具有良好的泛化能力。为什么?

一个关键洞察来自对损失 landscape 几何形状的研究。想象损失曲面像一个崎岖的山脉,有无数山谷。有些山谷底部很窄很陡(尖锐最小值),有些山谷底部宽阔平坦(平坦最小值)。

平坦最小值假说


5.3 逃离鞍点:高维空间的几何恩惠


5.4 自适应学习率:Adam 的数学直觉

纯 SGD 有一个问题:所有参数共享同一个学习率。但在深度网络中,不同参数的梯度尺度可能差异巨大。嵌入层的梯度可能很小,而最后分类层的梯度可能很大。


六、泛化理论:为什么过参数化不必然过拟合

6.1 经典理论的困境:当教科书遭遇现实

传统统计学习理论告诉我们:模型复杂度应该与数据量匹配。参数太多,模型会过拟合。VC 维(Vapnik-Chervonenkis dimension)和 Rademacher 复杂度是衡量模型复杂度的经典工具。


6.2 过参数化的双重性:更多参数,更好泛化?

现代深度学习模型几乎都是"过参数化"的:参数数量远超训练样本数。理论上,这样的模型可以完美拟合训练数据(甚至拟合随机标签),达到零训练误差。这叫做"插值"。

经典理论预测,插值点之后测试误差应该上升。但实验观察到一个反直觉的现象:当模型容量超过插值阈值后,继续增加参数,测试误差反而再次下降。这被称为"双重下降"曲线——先下降,过拟合峰值,然后再次下降。



6.3 神经正切核:无限宽网络的线性近似

2018 年,Jacot、Gabriel 和 Hongler 提出了神经正切核(NTK)理论。他们证明:在无限宽极限下,神经网络的训练动态可以用一个固定的核函数来描述。

NTK 定义

NTK(x, x') = ∇θf(x;θ) · ∇θf(x';θ)


6.4 隐式正则化再探:优化算法的选择性


七、几何观点:流形假设与高维空间中的低维秩序

7.1 流形假设:高维空间里的低维秘密

想象一张揉皱的纸。在三维空间里,这张纸是一个复杂的皱褶结构。但如果你只关心纸的表面(忽略厚度),它本质上是一个二维流形——局部看起来像平面,整体可以弯曲和折叠。


7.2 网络如何"展平"流形:从混沌到秩序




7.3 流形假设的边界:并非万能


八、信息瓶颈:压缩与预测的永恒张力

8.1 Tishby 的洞见:预测与压缩的博弈


这个理论像一幅画,把深度学习的目标描绘得如此清晰:学习就是在预测和压缩之间走钢丝。预测太多,你会过拟合;压缩太多,你会丢失信息。最优的表示,恰好站在两者的平衡点上。

8.2 争议与修正:当理论遭遇挑战


8.3 变分信息瓶颈:把直觉变成算法


九、万能近似定理:表达能力的数学许可证

9.1 Cybenko 的定理:一张许可证


9.2 定理的局限:许可证不是操作指南


十、统一视角:数学作为深度学习的操作系统

让我们回到开头的问题:为什么梯度下降能在非凸、高维、过参数化的 landscape 中找到有效解?

现在我们可以给出一个更完整的答案:


结语:数学不是注脚,而是地基


数学不是深度学习的注脚。数学是深度学习的操作系统。



特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
为什么突然大家都讨厌梅西?这是宣传上的失败罢了

为什么突然大家都讨厌梅西?这是宣传上的失败罢了

西游日记
2026-07-25 21:02:41
导弹轰炸时正在上班,基洛夫兵工厂伤亡惨重!俄罗斯博主们恐惧乌军新司令

导弹轰炸时正在上班,基洛夫兵工厂伤亡惨重!俄罗斯博主们恐惧乌军新司令

鹰眼Defence
2026-07-25 16:47:58
周薪60万镑!曝阿森纳考虑签下巴西1.4亿巨星 合同剩1年+皇马愿出售

周薪60万镑!曝阿森纳考虑签下巴西1.4亿巨星 合同剩1年+皇马愿出售

我爱英超
2026-07-25 22:05:38
从太空高速冲回地球后,马斯克家最大的飞船,此刻正漂在印度洋上

从太空高速冲回地球后,马斯克家最大的飞船,此刻正漂在印度洋上

果壳
2026-07-25 09:54:23
官方:韩国国脚李刚仁加盟马竞;据悉转会总价约4000万欧

官方:韩国国脚李刚仁加盟马竞;据悉转会总价约4000万欧

懂球帝
2026-07-25 16:13:23
又一金饭碗走下神坛!曾经争抢加入银行的年轻人,如今开始辞职

又一金饭碗走下神坛!曾经争抢加入银行的年轻人,如今开始辞职

青眼财经
2026-07-25 10:23:37
巴勒斯坦快被打没了,为何全世界都不出手帮忙?原因其实很简单

巴勒斯坦快被打没了,为何全世界都不出手帮忙?原因其实很简单

混沌录
2026-07-24 20:59:08
北大删了邓煜的回答,因为舆论场容不下真话

北大删了邓煜的回答,因为舆论场容不下真话

ICT解读者
2026-07-25 10:30:44
Coco现状:定居上海洋房花园,财务自由,谢贤已为她安排好后半生

Coco现状:定居上海洋房花园,财务自由,谢贤已为她安排好后半生

白面书誏
2026-07-25 17:30:08
金球先生即将加盟!罗德里已同皇马达成一致,静等曼城点头

金球先生即将加盟!罗德里已同皇马达成一致,静等曼城点头

全景体育V
2026-07-25 17:57:10
沙特联军空袭胡塞武装,或更多海湾国家已卷入中东战场

沙特联军空袭胡塞武装,或更多海湾国家已卷入中东战场

红星新闻
2026-07-25 15:12:48
男篮大胜格鲁吉亚!李弘权+2后卫合砍44分,贺希宁再现低迷!

男篮大胜格鲁吉亚!李弘权+2后卫合砍44分,贺希宁再现低迷!

篮球资讯达人
2026-07-25 21:26:07
告诉你真实的台湾,2300万人口小岛却无比发达,是时候公开原因了

告诉你真实的台湾,2300万人口小岛却无比发达,是时候公开原因了

王嚾晓
2026-07-24 18:59:30
随着镇江队2-1、苏州队0-1、常州队0-0,苏超最新积分榜出炉

随着镇江队2-1、苏州队0-1、常州队0-0,苏超最新积分榜出炉

侧身凌空斩
2026-07-25 22:19:41
印度首都爆发大规模抗议并发生严重冲突

印度首都爆发大规模抗议并发生严重冲突

凤眼论
2026-07-24 16:57:25
法庭上杀人犯当场质问法官:“我明明杀了四个女人,你们为什么说我杀了3个?”

法庭上杀人犯当场质问法官:“我明明杀了四个女人,你们为什么说我杀了3个?”

落纸生花创意手工
2026-07-19 12:06:31
王祖贤这么缺钱吗,竟然把自己卖给了AI

王祖贤这么缺钱吗,竟然把自己卖给了AI

LULU生活家
2026-07-25 18:02:45
美国前警察身背命案逃亡海外,靠着外籍身份混入国内大学任教21年

美国前警察身背命案逃亡海外,靠着外籍身份混入国内大学任教21年

行者聊官
2026-07-25 14:32:55
张国立4S店试驾半小时干脆利落豪气下单

张国立4S店试驾半小时干脆利落豪气下单

暖心萌阿菇凉
2026-07-24 18:05:40
6个美国大学生游北京7天,返程全沉默,落地河内才开口

6个美国大学生游北京7天,返程全沉默,落地河内才开口

糖逗在娱乐
2026-07-25 16:43:43
2026-07-26 01:27:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4212317文章数 9013关注度
往期回顾 全部

科技要闻

星舰13飞全中!20颗真卫星出舱

头条要闻

河南退役军人被冒名顶岗获赔10万 5年后单位发函追讨

头条要闻

河南退役军人被冒名顶岗获赔10万 5年后单位发函追讨

体育要闻

拿过两个金球奖,却说它只值10英镑

娱乐要闻

王祖贤这么缺钱吗 竟然把自己卖给了AI

财经要闻

滥用市场支配地位 携程被罚没51.79亿元

汽车要闻

轿跑姿态+大空间/标配655km续航 奇瑞风云A9置换价10.68万起

态度原创

艺术
健康
本地
手机
公开课

艺术要闻

林俊杰破例献曲,只因看了她的画!这个“狂野少女”到底什么来头?看完我头皮发麻!

教你三步快速识别中风

本地新闻

跟着影视去旅行:西游篇

手机要闻

小米大会师旗舰三证齐全:玄戒O3+全自研大模型矩阵,MIX阔折叠下月见

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版