网易首页 > 网易号 > 正文 申请入驻

从零开始手撸大模型:损失函数从哪里来?从最大似然理解 MSE 与交叉熵

0
分享至

来源:市场资讯

(来源:图灵人工智能)


转自IT技术小密圈,仅用于学术分享,如有侵权留言删除报道

从零开始手撸大模型:损失函数从哪里来?从最大似然理解 MSE 与交叉熵。


在监督学习中,神经网络定义输入到输出的映射,损失函数则定义如何评价这组输出。回归常用均方误差,分类常用交叉熵,但这些公式并不只是一组经验搭配:它们可以从不同的条件概率模型中推导出来。

这条推导路径包含三个环节:为输出选择分布,让网络计算分布参数,再通过最大似然估计网络参数。分布不同,得到的负对数似然也不同。

下面讨论的是以负对数似然为训练目标的监督学习。它提供了一种系统的损失构造方法,但并不覆盖全部目标:当任务关心排序、间隔或特定决策代价时,也可能需要其他损失。

1. 从预测一个答案,到预测一个分布

点预测没有表达什么

一个回归网络通常写作:

其中,x 是输入,φ 是网络的权重与偏置,ŷ 是预测值。给定输入和参数,网络返回一个确定的结果。

以房价预测为例,输入可以包括面积、楼层和位置。即使这些特征相同,两套房子的成交价格也未必相同:装修、交易时间以及没有记录的议价因素,都会影响输出。观测过程本身也可能有噪声。

点预测能够给出一个代表值,却没有说明其他价格的可能性。为表达这部分信息,可以引入条件分布:

它描述的是:在给定 x 的条件下,输出 y 如何分布。这里被建模为随机变量的是输出;计算分布参数的网络本身仍可以是确定性的。

符号“|”读作“给定”:我们已经知道输入 x,要描述的是这个输入下输出的可能性。例如,给定房屋面积和位置后,不同成交价格分别有多大可能。分号后的 φ 表示控制这个分布的模型参数;它与待预测的输出 y 承担不同角色。

网络参数与分布参数

假设采用高斯分布,我们可以让网络输出均值 μ(x),也可以同时输出方差 σ²(x)。对分类任务,网络则可以输出定义类别概率所需的 logits。

因此需要区分:

  • 「网络参数 φ」:训练过程中更新的权重与偏置,供所有输入共享。

  • 「分布参数 θ(x)」:网络针对当前输入计算出的值,例如均值、方差或类别概率。

一种更明确的写法是:

g 可以包含网络以及必要的输出变换,例如用指数函数保证方差为正。确定分布族后,θ(x) 就确定了当前输入对应的分布。


分布预测仍然可以产生一个答案

实际系统最终可能只需要一个价格或类别。此时可以从预测分布中选择一个决策:回归中取条件均值,分类中取概率最大的类别,都是常见做法。

这种选择与评估目标有关。在平方误差下,最优的点预测是条件均值;在绝对误差下,对应的是条件中位数;在类别误判代价相同的情况下,选择最大概率类别可以最小化分类错误概率。

还要区分概率与概率密度。对于连续输出:

区间概率对应曲线下的面积。某一点的密度不是该精确取值出现的概率,密度也可以大于 1。因此,连续分布的负对数密度可能为负;不能仅凭损失的正负判断实现是否有误。

2. 最大似然:让模型更好地解释观测数据

从单个观测到整个数据集

设训练集为:

这里 N 是样本数,i 是样本索引。训练时,输入 xᵢ 和真实输出 yᵢ 都已经给定,需要调整的是网络参数 φ。

对于一个样本,模型在真实输出处给出的概率或密度为 p(yᵢ|xᵢ;φ)。在给定输入和参数后,假设不同样本的输出条件独立,整个数据集的似然就可以写成:

∏ 表示把所有样本对应的概率或密度相乘。这里相乘的依据是条件独立假设;对于存在依赖的数据,需要使用相应的联合分布或条件分解,不能直接照搬这个乘积。

最大似然估计选择使这个乘积最大的参数:

arg max 返回的是“使表达式最大的参数”,因此 φ̂ 是估计得到的一组参数,而不是似然的最大数值。

概率与似然:同一个表达式,两种考察方式

概率描述给定模型下,一个事件发生的可能性。例如,假设一枚硬币每次正面朝上的概率为 θ,且各次抛掷相互独立,那么模型就能回答“三次依次出现正、正、反的概率是多少”。

用 H 表示正面,T 表示反面。固定 θ=0.5 时:

这时模型已经确定,我们考察的是不同的可能结果。三次抛掷一共有 8 种有序序列;在公平硬币模型下,每种序列的概率都是 0.125,所有序列的概率相加为 1。

似然改变了考察方向。现在已经抛完硬币,记录到的结果就是 H、H、T,但 θ 未知。我们固定这条记录,比较不同 θ 对它给出多大的概率:

θ² 来自两次正面,1−θ 来自一次反面。这里讨论的是「按顺序记录的 H、H、T」,所以没有“从三次中选出两次正面”的组合系数。

假设的正面概率 θ

对同一条观测 H、H、T 给出的似然

0.5

0.5² × 0.5 = 0.125

2/3

(2/3)² × (1/3) ≈ 0.1481

0.9

0.9² × 0.1 = 0.081

虽然这条记录里正面更多,但 θ=0.9 把反面看得过于罕见,因此它对整条记录给出的似然反而更低。最大似然要求模型解释所有观测,包括那一次反面。

在这个例子中,对 θ²(1−θ) 求导得到 θ(2−3θ),结合区间 [0,1] 的边界,可以得到最大值位于 θ̂=2/3,也就是观测中的正面比例。这只是基于三次观测的估计,并不证明硬币真实的正面概率恰好等于 2/3。

两种考察方式可以概括为:

固定什么

比较什么

回答的问题

概率

模型参数

可能的观测结果

这个模型下,各种结果有多大可能?

似然

已经观测到的数据

候选模型参数

哪些参数给这份数据更高的概率或密度?

因此,“似然”不是一种新的数据分布,而是把同一个概率或密度表达式视为参数的函数。上表中的 0.1481 不是“θ=2/3 的概率为 14.81%”,不同参数的似然值也不需要相加为 1。若要讨论给定数据后的参数概率,需要另外建立关于参数的概率模型,例如在贝叶斯推断中引入先验并计算后验。

神经网络中的做法相同:固定训练集,调整 φ,网络随之改变每个输入对应的条件分布,再比较这些分布对真实输出给出的联合概率或密度。连续输出使用密度构造似然,考察方向不变。

为什么取对数,再加负号

对数函数严格单调递增,因此取对数不改变最大值的位置。同时,它把样本概率的乘积变成求和:

第一步仍在比较同一组参数;第二步利用 log(ab)=log a+log b,把乘积变为求和;最后加上负号,将“越大越好”改写成训练框架常用的“越小越好”。这些变换保持最优参数的位置。

由此得到「负对数似然(Negative Log-Likelihood,简称 NLL)」:

其中,每一项 −log p(yᵢ|xᵢ;φ) 是一个样本的损失,全文用 ℓ 表示单样本损失,用 ℒ 表示数据集上的总损失。对于离散输出,给真实结果的概率为 1 时,该项为 0;概率越接近零,该项越大。例如,真实结果的概率从 0.1 提高到 0.5,损失会从约 2.303 降到 0.693。


在实现中,应直接计算对数概率或其稳定等价形式,而不是先算一个可能下溢的乘积,再对乘积取对数。本文的 log 均指自然对数。

把总损失除以 N,会得到平均负对数似然。对于固定数据集、没有其他附加项的目标,求和与平均具有相同的最优解,但梯度相差 N 倍。若还包含固定权重的正则项,只缩放数据项就会改变两者的相对权重。

最后,最大化训练似然只规定如何拟合训练数据。它不能保证未知数据上的表现;模型复杂度、数据规模与正则化等因素仍然影响泛化。

3. 回归:高斯分布如何导出平方误差

建立高斯观测模型

对单个连续输出,假设:

等价地,可以把输出写成 y=μ(x)+ε,其中条件噪声 ε 服从均值为零、方差为 σ² 的高斯分布。

单个样本的概率密度是:

μ(x) 决定分布的中心,σ² 决定分布的宽窄。指数中的 y−μ(x) 是残差,除以 σ 后得到以标准差为单位的偏离程度。因此,密度取决于观测距离预测均值有多远,以及这个距离相对于噪声尺度有多大。前面的系数保证整条密度曲线下的面积为 1。

对它取负对数:

这一步用到了 −log(ab)=−log a−log b,以及 log(exp u)=u:归一化系数变成第一项,指数中的负平方项变成正的平方惩罚。方差越小,同样的残差会受到越强的惩罚。例如,残差均为 2 时,σ=1 对应偏离两个标准差,σ=2 则只偏离一个标准差;残差项分别为 2 和 0.5。比较完整 NLL 时,还必须计入第一项。

哪些条件下可以得到 MSE

假设所有样本共享一个固定的正方差 σ²。对网络参数 φ 而言,第一项是常数,第二项前面的 1/(2σ²) 是固定正系数。因此:

这里能够去掉常数,是因为给所有候选参数的目标值都加上同一个数,不会改变它们的大小关系;乘上固定正系数也一样。若这一“系数”本身需要学习,就不能这样处理。

右侧是平方误差之和。再按样本平均,就得到均方误差(Mean Squared Error,MSE):

这里的结论是「优化目标具有相同的最优解」,并不是 NLL 与 MSE 的数值相等。如果各样本的方差已知但不同,得到的则是按方差倒数加权的平方误差。


误差从 1 增加到 2,平方惩罚从 1 增加到 4。这对应高斯密度随平方距离指数衰减的形式。极端残差因而可能对目标产生很大影响;平方损失对预测值的导数也随残差线性增长。

高斯模型为 MSE 提供了概率解释,但实际使用 MSE 并不要求先证明数据严格服从高斯分布。分布假设是否合适,需要结合残差特征和最终评价目标判断。

方差由网络预测时,损失不能简化为 MSE

有些输入对应的输出更稳定,有些输入的不确定性更大。这时可以让网络同时预测 μ(x) 和 σ²(x),形成异方差模型。

为保证方差为正,让网络输出对数方差:

将它代回 NLL,并记残差 r=y−μ(x):


固定一个非零残差时,增大 s 会降低残差项 r²e⁻ˢ/2,却会增大 s/2。因此不能仅通过无限增大方差来持续降低损失。

从导数也能看出这一点:

固定非零 r 时,驻点满足 σ²=r²。这是针对单个残差的局部分析,实际模型的均值和方差由共享参数共同学习。若模型精确拟合某个观测,r=0 时单样本目标又可能推动方差趋近于零;实践中可以通过方差下界或其他约束控制这种退化。

4. 二分类:伯努利分布如何导出交叉熵

二分类的输出是 y∈{0,1}。设正类概率为 p,那么负类概率就是 1−p。伯努利分布可以把这两种情况统一写成:

在 sigmoid 给出 0

网络的原始输出 z 可以取任意实数。通过 sigmoid,可以将它转换为合法的概率参数:

z 称为 logit,它与对数几率的关系为:

z=0 对应 p=0.5;z 越大,正类概率越高。这个变换负责参数约束,伯努利分布负责描述标签,两者承担不同作用。

将伯努利概率代入负对数似然:

取对数后,乘积变成和,指数 y 与 1−y 移到对数前面。这就是二元交叉熵(Binary Cross-Entropy,BCE)。它衡量的是模型给真实标签的概率,而不仅是最后有没有分对类别。


对于硬标签,每次只剩下一项。若 p=0.9,真实标签为 1 时损失约为 0.105;真实标签为 0 时,损失约为 2.303。模型给真实类别的概率越接近零,损失越大。

概率预测与类别决策也应分开。以 0.5 为阈值时,0.6 和 0.9 都判为正类,但 BCE 能区分它们。阈值还可以根据误判代价调整,调整阈值不等于改变模型预测的概率。

5. 多分类:softmax 如何连接类别与概率

从 logits 到分类分布

如果每个样本属于 K 个类别中的一个,可以用分类分布描述输出。网络先产生 K 个 logits:

softmax 将它们转换成概率向量:

每个概率为正,且总和为 1。给所有 logits 加上相同常数,不会改变输出概率,因此决定概率的是 logits 之间的相对差异。

分子把任意实数分数转换为正数,分母再用这些正数的总和进行归一化。例如,三个 logits 为 [log 2,0,0] 时,指数结果为 [2,1,1],除以总和 4,就得到 [0.5,0.25,0.25]。原始 logit 不是概率;softmax 才将整组分数转换成一个类别分布。

真实类别为 c 时,观测到该类别的概率为 p_c,单样本 NLL 就是:

如果把标签编码成 one-hot 向量 y,其中只有 y_c=1,其余位置为零,则同一损失写作:

例如,真实类别为猫,预测概率为猫 0.7、狗 0.2、鸟 0.1,损失就是 −log 0.7,约为 0.357。

虽然公式只选取真实类别概率,其他 logits 仍通过 softmax 分母影响它。对 logit 求导可得:

对于真实类别,梯度是 p_c−1;对于其他类别,梯度是 p_k。若直接对 logits 做梯度下降,前者会推动真实类别分数增大,后者会推动其他类别分数减小。在网络训练中,这些梯度再通过链式法则传到共享参数。因此,非真实类别的 logits 同样会收到梯度。

多标签任务采用不同的概率结构

如果一张图片可以同时包含猫和狗,目标可能是 [1,1,0]。它描述多个二元事件,而不是一个互斥类别。

常见模型为每个标签使用独立的 sigmoid。在给定输入后,将标签建模为条件独立的伯努利变量:

取负对数后,就得到各标签 BCE 之和。此时 p₁=0.9、p₂=0.8 完全合法,各标签概率不需要加起来等于 1。


条件独立是联合分布的建模假设,不意味着现实中的标签互不相关。不同标签的预测仍可以共享网络特征;如果需要进一步描述给定输入后的标签依赖,则要采用更丰富的联合模型。

6. 为什么它叫“交叉熵”?

前面通过观测数据的似然推导了分类损失。“交叉熵”这个名称则来自目标分布与预测分布之间的关系。

设 q 是目标类别分布,p 是模型预测分布,交叉熵定义为:

它计算的是:按照目标分布 q 的权重,对预测负对数概率求平均。权重来自 q,对数作用于 p,两者的位置不能交换。

这里的期望符号 E 表示加权平均:类别 k 按照 q 出现,每次用 −log p_k 评价模型。信息论中,−log p_k 称为该结果在分布 p 下的自信息;模型认为越罕见的结果,出现时对应的自信息越大。用 q 决定结果出现的频率,却用 p 计算自信息,这就是“交叉”所表达的关系。本文使用自然对数,单位为 nat;若改用以 2 为底的对数,单位为 bit。

硬标签与软标签

对于 one-hot 目标 q_c=1,交叉熵退化为 −log p_c,恰好就是单个类别标签的负对数似然。对训练样本取平均,就得到常见的分类训练目标。

但 one-hot 表示的是这个样本提供的监督信息,并不证明真实条件分布在该输入处没有不确定性。

如果目标是软标签,例如 q=[0.7,0.2,0.1],损失变为:

多个类别都会参与加权。这可以理解为目标分布下的期望负对数似然,而不是某个单一类别观测的 NLL。


交叉熵与 KL 散度

如果评价所用的分布也取 q,就得到熵 H(q)=−Σₖqₖlog qₖ,它描述 q 自身的不确定性。例如,二分类 q=[0.5,0.5] 的熵为 log 2,约 0.693;确定标签 q=[1,0] 的熵为 0。交叉熵则同时取决于目标分布 q 和预测分布 p。

从 KL 散度定义出发:

因此:

当目标 q 固定时,H(q) 不随网络参数变化,最小化交叉熵等价于最小化这个方向的 KL 散度。若模型能够表示 q,则 p=q 时交叉熵达到 H(q)。对软标签而言,这个最小值通常不是零。

例如,q=[0.5,0.5] 时,预测 p=[0.5,0.5] 得到交叉熵约 0.693;改成 p=[0.9,0.1] 后,交叉熵变为 −0.5 log 0.9−0.5 log 0.1≈1.204。两者相差约 0.511,正是后一个预测对应的 KL 散度。这部分是预测分布偏离目标分布所增加的代价;目标分布自身的熵没有改变。

上述关系采用 0 log 0=0 的约定。若某类别 q_k>0,而模型给出 p_k=0,交叉熵会发散。有限 logits 的 softmax 在数学上给出正概率,但浮点计算仍需稳定实现。

7. 如何为新任务构造损失函数?

先确定输出空间和分布参数

一个可复用的过程是:先确定 y 的取值范围,再选择条件分布族,明确需要预测哪些参数及其约束,最后计算负对数似然。

输出取值范围只约束候选分布,不能唯一决定它。例如,同为连续输出,可以使用高斯、拉普拉斯或更复杂的分布;选择还取决于尾部形态、不确定性和建模目的。

拉普拉斯分布导出绝对误差

假设连续输出服从拉普拉斯分布:

其 NLL 为:

这里 μ(x) 是位置参数,b 是尺度参数,b 越大,分布越宽。推导与高斯模型相同;区别在于密度的指数中使用绝对距离,所以取负对数后保留下来的是绝对误差。

当尺度 b 固定时,最小化它等价于最小化绝对误差。相比平方误差,绝对误差对大残差的惩罚增长较慢。这对应拉普拉斯分布与高斯分布不同的尾部假设。

若 b 也由模型预测,则 log(2b) 不能省略,理由与学习高斯方差时相同。

泊松分布用于计数输出

对于请求数、事件数等非负整数输出,可以考虑泊松模型:

λ(x) 表示给定输入下的预期计数,例如固定一分钟内的预期请求数;y! 是阶乘,且 0!=1。模型为每个非负整数分配概率,这些概率相加为 1。

令网络输出 a(x),并设 λ(x)=exp(a(x)),便可保证 λ>0。负对数似然为:

训练数据固定时,log(y!) 不影响模型梯度;若要报告完整 NLL,则应保留。泊松模型还假设条件均值与条件方差都等于 λ。若计数明显呈现更大的条件方差,这个分布假设就可能不够合适。


多输出何时可以直接相加

设输出向量为 y=(y₁,…,y_D)。若模型采用条件独立假设:

那么:

这给出了各维损失相加的依据。若要描述连续输出间的相关性,可以使用协方差矩阵为 Σ 的多元高斯分布,其 NLL 包含:

其中,|Σ| 表示协方差矩阵的行列式,Σ⁻¹ 是逆矩阵,上标 T 表示转置。最后一项先按协方差描述的尺度和相关方向衡量残差,再计算平方距离;它是单变量 r²/σ² 的推广。log|Σ| 则对应多维分布的尺度项。

Σ 需要正定;当它含有非零的非对角元素时,残差之间会发生耦合,通常不能再简化为各维独立平方误差。当 Σ=σ²I 时,最后一项才退化为各维平方残差之和除以 2σ²。


不同输出的单位和噪声尺度也会影响损失。独立高斯模型中的 1/(2σ²) 就提供了一种有概率意义的权重。因此,将多个任务损失相加之前,需要明确它们的尺度和建模假设。额外设置任务权重可以服务于应用目标,但此时不一定还等价于原先那个联合模型的最大似然。

8. 从公式到 PyTorch

先匹配输入、标签和接口

下面只考虑无类别权重、无忽略标签、无标签平滑的基本情况。用 N 表示批量大小,K 表示类别数或标签数:

任务

网络输出

目标

常用接口

回归

连续预测值

同形状浮点数

MSELoss

二分类

[N]

原始 logits

[N]

浮点数,硬标签为 0 或 1

BCEWithLogitsLoss

互斥多分类

[N,K]

原始 logits

[N]

整数类别索引

CrossEntropyLoss

多标签分类

[N,K]

原始 logits

[N,K]

浮点数,硬标签为 0 或 1

BCEWithLogitsLoss

BCEWithLogitsLoss接收原始 logits,并将 sigmoid 与二元交叉熵结合计算。CrossEntropyLoss对类别索引目标等价于 LogSoftmax 与 NLLLoss 的组合。调用这两个接口前,不需要自行执行 sigmoid 或 softmax。BCE 接口说明、多分类接口说明

CrossEntropyLoss也支持概率目标;此时目标与 logits 同形状,使用浮点数,每行表示一个合法的类别分布。下面的代码采用硬标签路径。


为什么要合并计算

二分类中,把 p=σ(z) 代入 BCE,可以整理为:

为了避免 eᶻ 溢出,可以使用稳定等价式:

这里需要使用 log1p一类实现来计算 log(1+u)。这种形式也避免先把 sigmoid 结果舍入成 0 或 1,再对其取对数。

多分类同样可以直接在 logits 上计算:

令 m=maxⱼ zⱼ:

减去最大值后,指数输入不大于零,可以避免正向溢出。数学上等价的计算式,在浮点运算中可能有明显不同的稳定性。

对照手工公式与框架结果

下面的程序可以独立运行。它使用 float64 和适中的 logits,分别检查 MSE、BCE、多分类交叉熵和多标签归约方式。函数式接口与上表中的模块对应。

import torchimport torch.nn.functional as Fdtype = torch.float64# 回归:逐元素平方误差pred = torch.tensor([2.5, 4.0, 5.5], dtype=dtype)target = torch.tensor([3.0, 4.0, 5.0], dtype=dtype)mse = F.mse_loss(pred, target)torch.testing.assert_close(mse, ((pred - target) ** 2).mean())# 二分类:显式概率公式只用于适中 logits 的数值对照z = torch.tensor([2.0, -1.0, 0.5], dtype=dtype)y = torch.tensor([1.0, 0.0, 1.0], dtype=dtype)p = z.sigmoid()bce_manual = -y * p.log() - (1 - y) * torch.log1p(-p)bce = F.binary_cross_entropy_with_logits(z, y, reduction="none")torch.testing.assert_close(bce, bce_manual)# 多分类:类别索引采用 0 到 K-1z_multi = torch.tensor([[2.0, 0.5, -1.0],[0.1, 1.2, 0.3]], dtype=dtype)classes = torch.tensor([0, 1], dtype=torch.long)rows = torch.arange(classes.numel())ce_manual = torch.logsumexp(z_multi, dim=1) - z_multi[rows, classes]ce = F.cross_entropy(z_multi, classes, reduction="none")torch.testing.assert_close(ce, ce_manual)# 多标签:每个样本、每个标签都产生一个 BCEy_multi = torch.tensor([[1.0, 1.0, 0.0],[0.0, 1.0, 0.0]], dtype=dtype)element_loss = F.binary_cross_entropy_with_logits(z_multi, y_multi, reduction="none"default_mean = F.binary_cross_entropy_with_logits(z_multi, y_multi)sample_nll = element_loss.sum(dim=1)torch.testing.assert_close(default_mean, element_loss.mean())torch.testing.assert_close(sample_nll.mean(), default_mean * z_multi.shape[1]print(f"MSE: {mse.item():.6f}")print(f"BCE mean: {bce.mean().item():.6f}")print(f"CE mean: {ce.mean().item():.6f}")print("手工公式与框架结果一致")

在 PyTorch 2.8.0、CPU、float64 下运行,三项输出分别为 0.166667、0.304756和 0.397437,上述一致性断言全部通过。

这里的 reduction="none"保留未归约的损失。sum对这些元素求和,mean对它们求平均。

需要注意归约的对象:对 [N,K]的多标签 BCE,默认平均覆盖全部 NK 个元素;若按照独立标签联合似然的定义,先对 K 个标签求和、再对 N 个样本平均,结果会是默认值的 K 倍。两种约定都可以使用,但比较数值、选择学习率或合并其他损失时应保持一致。

极端 logits 下的区别

下面的程序故意构造高置信度错误,用朴素表达式展示数值问题:

import torchimport torch.nn.functional as F# y=0,但模型极度偏向正类z = torch.tensor([1000.0], dtype=torch.float64)y = torch.zeros_like(z)naive_bce = -torch.log(1 - torch.sigmoid(z))stable_bce = F.binary_cross_entropy_with_logits(z, y)# 真实类别为第二类,但第一类 logit 极大logits = torch.tensor([[1000.0, 0.0]], dtype=torch.float64)target = torch.tensor([1])naive_ce = torch.log(torch.exp(logits).sum(dim=1)) - logits[:, 1]stable_ce = F.cross_entropy(logits, target)assert torch.isinf(naive_bce).all()assert torch.isinf(naive_ce).all()torch.testing.assert_close(stable_bce, z[0])torch.testing.assert_close(stable_ce, z[0])print("朴素计算:", naive_bce.item(), naive_ce.item())print("稳定计算:", stable_bce.item(), stable_ce.item())

两个稳定损失都接近 1000,这与模型给真实类别极低概率的情况一致。稳定实现不会消除预测错误带来的惩罚,它避免的是有限的数学结果在中间计算中变成无穷大。

总结

输出类型

分布假设

网络预测的分布参数

负对数似然对应的目标

常见实现

连续值

固定方差高斯

均值 μ

平方误差

MSELoss

连续值

异方差高斯

均值、方差

完整高斯 NLL

GaussianNLLLoss

二元类别

伯努利

正类概率 p

BCE

BCEWithLogitsLoss

互斥类别

分类分布

类别概率向量

多分类交叉熵

CrossEntropyLoss

多个二元标签

条件独立伯努利

各标签概率

各标签 BCE 之和

BCEWithLogitsLoss

配合归约

连续值

固定尺度拉普拉斯

位置 μ

绝对误差

L1Loss

非负计数

泊松

率参数 λ

泊松 NLL

PoissonNLLLoss

表中的“对应”不保证框架默认值包含完整 NLL 的全部常数项;使用高斯、泊松等接口报告概率模型的绝对分数时,还需要检查参数约定与常数项选项。

MSE 与交叉熵的差别,来自它们对输出分布的不同描述。为新任务选择损失时,需要同时考察输出空间、噪声尺度、类别关系与输出依赖,并核对实现是否保留了模型所需的项。最大似然将这些假设转化为训练目标,最终是否适合应用,仍要通过数据和评估指标检验。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
不是景甜舍不得3000万,查了下才知道,原来她穷得日子也不好过

不是景甜舍不得3000万,查了下才知道,原来她穷得日子也不好过

天天热点见闻
2026-08-29 08:53:35
76岁还不退休!美国大法官和特朗普较劲:明年再谈卸任

76岁还不退休!美国大法官和特朗普较劲:明年再谈卸任

夜里看海
2026-10-04 06:59:32
29岁长了张仙风道骨的脸!小哥自带漫威原皮,火成现实版金刚狼

29岁长了张仙风道骨的脸!小哥自带漫威原皮,火成现实版金刚狼

英国那些事儿
2026-09-30 00:58:14
迪拜客机驾驶舱血案调查曝惊人动机,阿以罕见同时定性为恐袭,副驾驶曾因极端观点被前东家禁飞,飞行员筛查能否识别隐蔽风险

迪拜客机驾驶舱血案调查曝惊人动机,阿以罕见同时定性为恐袭,副驾驶曾因极端观点被前东家禁飞,飞行员筛查能否识别隐蔽风险

澎湃新闻
2026-10-03 14:59:03
日本男足摘银全队沮丧!多人 领奖台捂脸+落泪 中韩球员一路大笑太扎心

日本男足摘银全队沮丧!多人 领奖台捂脸+落泪 中韩球员一路大笑太扎心

颜小白的篮球梦
2026-10-04 04:11:49
满足了谁的性癖?《脱衣麻将》圣光被做成手机App

满足了谁的性癖?《脱衣麻将》圣光被做成手机App

游民星空
2026-10-02 13:15:34
摩根大通重磅研判:2027 年中国房子供应减少 30%,房价正式迎来拐点

摩根大通重磅研判:2027 年中国房子供应减少 30%,房价正式迎来拐点

专业聊房君
2026-10-03 16:40:12
这是iQOO 16的首销数据,安卓母品牌全沉默了

这是iQOO 16的首销数据,安卓母品牌全沉默了

科技锋说
2026-10-04 07:32:45
996把年轻人榨成电池冲上热搜,网友大吐苦水,人心散了,队伍不好带了以后!

996把年轻人榨成电池冲上热搜,网友大吐苦水,人心散了,队伍不好带了以后!

眼光很亮
2026-09-28 14:28:35
中国癌症高发,是鸡肉吃多了?提醒:这3种肉,确实要少吃

中国癌症高发,是鸡肉吃多了?提醒:这3种肉,确实要少吃

医学科普汇
2026-08-28 22:25:07
英伟达重返世界之巅,市值逼6万亿美元!但斌激动万分,大摩:再涨30%

英伟达重返世界之巅,市值逼6万亿美元!但斌激动万分,大摩:再涨30%

金石随笔
2026-10-04 07:36:40
55岁马斯克再次分手!女方晒出两人最后的聊天记录,发长文告别!

55岁马斯克再次分手!女方晒出两人最后的聊天记录,发长文告别!

小先生笔记
2026-10-03 16:56:10
AI引发论文大爆炸,审稿体系濒临崩塌:arXiv也开始最严限流了

AI引发论文大爆炸,审稿体系濒临崩塌:arXiv也开始最严限流了

新智元
2026-10-03 12:23:38
丰田再降价!2026款车型,14万落地!

丰田再降价!2026款车型,14万落地!

手机评测室
2026-10-04 11:49:24
长江黄河每年数十亿条鱼被冲进大海:有的当场渴死,有的原地变身

长江黄河每年数十亿条鱼被冲进大海:有的当场渴死,有的原地变身

掠影后有感
2026-07-08 10:10:31
天文学家:首次探测到来自太阳系外行星的无线电信号

天文学家:首次探测到来自太阳系外行星的无线电信号

观察者网
2026-10-04 07:51:05
四大血型排行榜公布:B型血平均年龄76岁,排名第二,第1是哪型?

四大血型排行榜公布:B型血平均年龄76岁,排名第二,第1是哪型?

健身狂人
2026-10-02 20:34:12
170名哈马斯记者被亮身份,雇主纽约时报们正轻描淡写劫机案

170名哈马斯记者被亮身份,雇主纽约时报们正轻描淡写劫机案

移光幻影
2026-10-03 14:04:57
山西肉铺伤人后续:又杀害两名顾客,3人当场死亡,家属曝隐情

山西肉铺伤人后续:又杀害两名顾客,3人当场死亡,家属曝隐情

离离言几许
2026-06-16 20:59:36
对手都不习惯没有C罗,为了2030世界杯,葡萄牙足协进退两难

对手都不习惯没有C罗,为了2030世界杯,葡萄牙足协进退两难

足坛刘脂导
2026-10-03 22:29:31
2026-10-04 13:31:00
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4955015文章数 9714关注度
往期回顾 全部

科技要闻

苹果确认:iPhone 18 Pro Max有问题

头条要闻

牛弹琴:中国的两个邻国又开枪两人被打死 形势很严峻

头条要闻

牛弹琴:中国的两个邻国又开枪两人被打死 形势很严峻

体育要闻

“小将”吴曦,中国的莫德里奇

娱乐要闻

杨议没料到,郭德纲如今仍是一呼百应

财经要闻

OpenAI前安全部门员工:公司文化已崩坏

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

时尚
家居
本地
教育
公开课

今年秋天的上衣,太上头了!

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

教育要闻

用5个3组成最大的数字是多少?真难啊

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版