序列特征恢复中的标度律:一个可解层次模型
Scaling Laws from Sequential Feature Recovery:A Solvable Hierarchical Model
https://arxiv.org/pdf/2605.14567
![]()
![]()
摘要
我们提出了一种简单的机制,解释了缩放定律如何从多层网络中的特征学习中涌现。我们研究了一个高维层次化目标,该目标在全局上是一个高阶函数,但可以通过潜在组合特征的组合来表示,这些特征的权重按幂律衰减。我们表明,一种适应于此组合结构的逐层谱算法,相较于浅层、非自适应方法,能够实现更优的缩放性能,并顺序地恢复潜在方向:强特征在小样本量下即可被检测到,而弱特征则需要更多数据。我们证明了针对单个特征的尖锐恢复阈值,并表明聚合这些跃迁会产生预测误差的显式幂律衰减。在技术层面,该分析依赖于随机矩阵方法和基于预解式的微扰论证,这为单个特征向量的恢复提供了匹配的上下界,超越了标准基于谱间隙的微扰界所能提供的范围。数值实验证实了预测的顺序恢复、阈值的有限尺寸平滑效应,以及与非层次化核基线方法的分离。综上所述,这些结果表明平滑的缩放定律如何从一系列尖锐的特征学习跃迁中涌现。
1 引言
尽管神经网络在经验上取得了成功,我们仍然缺乏一种预测性理论来回答一个看似简单的问题:给定一个结构化的学习问题,哪些特征会被首先学习,以及它们的顺序发现如何转化为统计效率?这个问题位于三个活跃研究方向的交汇处。首先,神经缩放定律表明,大模型的性能在数据、算力或模型规模上遵循幂律(Kaplan等,2020;Brown等,2020;Hoffmann等,2022;Bahri等,2024)。然而,大多数数学理论依赖于线性化模型、核模型或随机特征模型,其中相关表征是预先固定的,学习过程由该表征的谱所控制(Caponnetto和De Vito,2007;Bordelon等,2020;Spigler等,2020;Cui等,2021,2023;Defilippis等,2024)。其次,许多工作强调特征学习不一定是平滑的:训练过程可能表现出平台期、风险的急剧下降,以及特征或概念的顺序涌现(Saxe等,2014;Wei等,2022;Schaeffer等,2023;Ren等,2025;Defilippis等,2026a)。第三,近期的理论开始分离深度在组合任务中的计算优势,即更深的架构能够发现浅层方法无法访问的中间表征(Cagnetta等,2024;Garnier-Brun等,2025;Dandi等,2025;Wang等,2023;Nichani等,2024;Fu等,2025;Tabanelli等,2026)。
本文探讨缩放定律是否并非源于固定的谱偏置,而是源于数据中相关特征的逐步揭示,正如深度神经网络中可能发生的那样。我们研究了一个在数学上可处理的高维任务,该任务需要跨多个层恢复隐藏特征。这些潜在特征通过具有幂律分布的权重进行组合。统计上检测单个特征所需的样本量与特征强度的平方成反比:强特征首先被学习,弱特征随后被学习,而预测误差由尚未恢复的隐藏谱尾部所主导。高效求解该任务需要解开组合结构。这种层次结构与各向异性的结合,导致适应或未适应任务几何的预测器产生不同的缩放定律。
![]()
![]()
我们通过数值实验对理论进行了补充,验证了潜在方向的顺序恢复、预测的尖锐渐近阈值的有限尺寸平滑效应,以及由此产生的均方误差衰减。我们还将层次化谱方法与非层次化核基线方法进行了比较。这些比较说明了组合结构的作用:尽管目标是输入的高阶函数,但利用其层次结构允许学习者在更低的样本尺度下恢复相关的潜在表征。
我们的主要贡献如下:
• 我们引入了一项结合层次结构与组合结构的高维任务,为研究缩放定律提供了一个可处理的设定,在该设定中,深度和特征学习对于高效学习都是必需的。
• 我们在高维极限下证明了谱算法恢复单个潜在方向的尖锐样本复杂度阈值。我们的结果基于一种超越该问题标准Davis-Kahan界的预解式特征向量微扰分析,我们认为该技术具有独立的学术价值。
• 我们表明,在此设定中缩放定律的涌现可以从聚合的谱跃迁来理解,其中误差由未学习的谱尾部控制。
• 我们提供了实验,证实了预测的恢复跃迁、有限尺寸效应,以及与浅层核方法的分离。
总体而言,我们的结果表明,幂律学习曲线可以源于一种简单且可解释的机制:层次化学习器逐一恢复潜在特征,而特征强度的幂律谱将这些尖锐的谱跃迁转化为平滑的缩放定律。
2 设定
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
因此,该模型预测平滑的幂律泛化是许多尖锐谱恢复跃迁的聚合效应。下一节将证明这一预测。
备注 2.1. 我们的逐层谱估计器与 (Tabanelli et al., 2026) 的学习策略紧密一致。特别是,他们在附录 C 中与梯度下降的联系表明,此处研究的谱估计器是在这种分层设定中基于梯度的训练自然涌现出来的那个。
2.3 更多相关工作
分层与组合模型。 深度通常被认为有效,是因为它允许利用数据中的分层或组合结构。这种直觉激发了从逼近论和统计学视角出发关于深度分离结果和组合目标模型的研究 (Telgarsky, 2016; Mhaskar et al., 2017; Poggio et al., 2017; Daniely, 2017; Mossel, 2016)。更近期的工作研究了随机分层模型和高维分层目标,表明深度网络或逐层过程可以利用浅层方法无法访问的中间表征 (Garnier-Brun et al., 2025; Cagnetta et al., 2024; Dandi et al., 2025)。与我们最接近的是对三层网络中分层多项式目标和非线性特征学习的分析 (Wang et al., 2023; Nichani et al., 2024; Fu et al., 2025),以及 (Tabanelli et al., 2026) 的分层谱方法。我们通过这些工作的不同之处在于,我们在潜在特征上增加了各向异性幂律谱,并证明了单个特征恢复的匹配上下界,这使我们能够从跃迁级联中推导出聚合缩放定律。
多索引与谱方法。 相关的一条研究路线研究多索引模型,其中目标取决于输入的低维投影。这些已被用于刻画统计-计算差距、弱恢复阈值以及核方法的局限性 (Aubin et al., 2018; Barbier et al., 2019; Ben Arous et al., 2021; Abbe et al., 2022; Bietti et al., 2022; Troiani et al., 2025; Damian et al., 2024)。谱方法在此背景下尤为相关,因为它们为高斯模型中的低维结构提供了尖锐的恢复保证 (Lu and Li, 2020; Mondelli and Montanari, 2018; Maillard et al., 2022; Kovačević et al., 2025; Defilippis et al., 2025)。我们的估计器建立在这一谱观点之上,但与标准的多索引学习不同之处在于,其潜在结构是组合性的,且恢复方向的强度是各向异性且服从幂律分布的。
缩放定律与幂律谱。 大量工作研究了在表征固定设定下的缩放定律,例如在核或随机特征模型中,其中泛化由相关特征映射的谱控制 (Caponnetto and De Vito, 2007; Bordelon et al., 2020; Spigler et al., 2020; Cui et al., 2021; Maloney et al., 2022; Cui et al., 2023; Bahri et al., 2024; Paquette et al., 2024; Defilippis et al., 2024; Atanasov et al., 2024; Bordelon et al., 2024a; Wortsman and Loureiro, 2025)。另一条独特的研究路线调查了增加可训练参数数量如何影响优化、初始化和表达能力 (Yang et al., 2021; Bordelon et al., 2024b; Chizat and Netrapalli, 2024; Chaintron et al., 2026)。更近期,关于二次和浅层神经网络模型的几项工作展示了缩放定律如何从特征学习本身产生 (Ren et al., 2025; Ben Arous et al., 2025; Defilippis et al., 2025, 2026b; Boncoraglio et al., 2025)。与我们工作最接近的是 (Defilippis et al., 2025, 2026b),它们获得了相关的速率和学习到的表征谱,包括学习方向的顺序涌现。本工作表明,类似的速率出现在真正的多层、分层设定中,这表明联系幂律谱、特征恢复和缩放定律的机制在浅层二次模型之外也是稳健的。
高斯等价性与多项式特征。 相关的技术文献研究了多项式特征映射、随机特征矩阵和高维核矩阵的高斯等价性和普适性现象 (Hu et al., 2024; Xu et al., 2025; Wen et al., 2025; Lu and Yau, 2025)。尽管我们的证明并非通过将埃尔米特特征向量替换为等价的高斯模型来进行,但这一系列工作为理解多项式特征何时表现得像高斯特征以及何时非高斯修正变得相关提供了有用的比较点。相反,我们的分析保持埃尔米特结构的显式性,并使用维纳混沌(Wiener-chaos)工具,如乘积公式、分部积分、超压缩性(hypercontractivity)和收缩估计 (Nualart and Pecatti, 2005; Nourdin and Peccati, 2009, 2012)。这些工具使我们能够直接控制经验埃尔米特矩矩阵和微扰特征向量展开,而无需诉诸完全的高斯等价归约。
3 主要定理
我们现在将在以下两种情形之一中,严格证明上一节所述启发式方法得出的预测。
假设 3.1(读出机制)。 我们在以下两种机制之一下进行工作:
![]()
3.1 第一层的恢复
![]()
定理 3.1(弱恢复)
![]()
![]()
![]()
3.2 第二层的恢复与泛化误差的速率
![]()
![]()
![]()
4 数值实验
在本节中,我们将定理 3.1 的逐特征恢复预测与数值实验进行对照。额外的数值细节见附录 A。
![]()
![]()
![]()
![]()
![]()
![]()
![]()
5 讨论与未来方向
我们引入了一个模型,其中缩放定律源于顺序特征恢复。核心信息是层次结构与各向异性协同作用:深度揭示了相关的中间表征,而信号的幂律结构将其各分量的恢复分散在不同的样本规模上。因此,平滑的幂律学习曲线可以从许多尖锐的特征学习跃迁的聚合效应中涌现。这提供了一种机制,说明幂律是由表征学习生成的,而不是从固定的核谱中继承而来的。
我们分析的主要局限性也正是使该机制变得清晰透明的原因:层次结构是预先指定的,输入为高斯分布,且学习是通过逐层过程执行的。这些假设使得尖锐的恢复与未恢复保证成为可能,同时指出了自然的后续问题:将该机制扩展到更通用的数据、更丰富的非线性以及更高的信息指数。更广泛地说,我们的结果表明,深度学习中的缩放定律可能不仅反映了固定表征处的谱偏置,还反映了跨深度的表征的逐步组织。
原文链接:https://arxiv.org/pdf/2605.14567
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.