网易首页 > 网易号 > 正文 申请入驻

早于 LeCun 相似研究一年!千诀科技联合清华团队提出神经网络“复杂度标尺”

0
分享至

对于机器人而言,在训练环境中完成任务并不算最难,真正困难的是进入一个没有见过的房间、面对新的物体或任务时,仍然能够作出正确判断。

这背后对应着具身智能的一项核心能力——泛化。一个机器人大脑究竟学到了可以迁移的规律,还是仅仅以复杂方式“记住”了训练数据?过去,我们可以通过成功率评价机器人做得对不对,却很难直接衡量其内部策略到底有多复杂、能否适应新环境。

千诀科技联合清华大学团队为此提出了一把新的神经网络“复杂度标尺”——有效阶(Effective Degree,ED)。它将抽象的“简单性偏置”转化为一个能够在真实规模模型上计算、比较并直接参与训练的指标,让研究者不仅可以测量模型学到的规律有多复杂,还能在训练中主动减少不必要的高阶变化。

这项研究目前验证于视觉、语言、视觉—语言模型和强化学习等任务。其潜在价值在于,为机器人大脑筛选模型、诊断训练过拟合,以及提升策略面对新任务和新环境时的泛化能力,提供一种新的技术路径。

值得关注的是,这条研究路线还与图灵奖得主 Yann LeCun 团队近期受到关注的世界模型理论形成呼应,而千诀科技与清华团队对相似方法论视角的公开研究,比 LeCun 团队早约一年。

今年 5 月, Yann LeCun 与 David Klindt、Randall Balestriero 的论文《When Does LeJEPA Learn a World Model?》一经发布便获得广泛关注。论文从隐变量可辨识性的角度研究 LeJEPA 驱动的世界模型,并用 Hermite 多项式将高斯世界中的函数按非线性次数分解:非线性阶数越高,在 LeJEPA 的 alignment 目标下受到的惩罚越强,因此线性恢复真实隐变量成为最优解。

值得注意的是,清华大学自动化系陈峰教授和千诀科技的联合团队(第一作者章天任)就在 ICML 2025 论文《When Do Neural Networks Learn World Models?》中采用了相近的方法论视角:将“学习世界模型”形式化为对数据生成隐变量的恢复(辨识)问题,并通过正交函数基将复杂函数分解为不同阶次,研究神经网络在解空间的低阶偏置如何促使真实隐变量变得可辨识。

两项研究使用的数学工具并不完全相同:千诀-清华团队研究多任务学习设定下具有低阶偏好的神经网络模型,使用 Fourier-Walsh 变换分析离散布尔世界;LeCun 等人研究 LeJEPA 及带平稳动力学的高斯世界,使用 Hermite 多项式进行谱分解。但二者尝试回答的关键问题和技术路径又是相似的:从隐变量可辨识性出发,用函数的阶次刻画“简单性”,再借助训练目标对低阶解的偏好,解释模型何时能够恢复世界的真实结构。

如今,千诀-清华团队又把这条理论线索向现实模型推进了一步。

在 ICML 2026《Quantifying and Optimizing Simplicity via Polynomial Representations》工作中,研究团队不再只问“低阶偏好为何能帮助模型学到世界结构”,而是进一步追问:这种偏好能不能在真实的 ResNet、ViT、语言模型和强化学习策略网络上被直接测量,甚至被主动优化?

他们给出的答案是“有效阶”(Effective Degree,ED):沿真实数据点之间的插值路径观察高维神经网络,用正交多项式拟合模型输出,再根据不同阶次成分的权重计算函数复杂度。由此,“简单性偏置”从团队上一项工作中的理论假设,变成了一个兼具通用性、可计算性和可微性的实用工具。

要理解 ED 解决了什么问题,还要回到深度学习中的一个经典谜题:为什么参数量远多于训练样本的神经网络,依然能在未见数据上表现良好?

一个广为接受的解释是“简单性偏置”(simplicity bias):面对许多都能拟合训练数据的函数,神经网络及其训练过程并非随机选择,而是更倾向于学到相对简单的那个。类似奥卡姆剃刀,越简单的规律,往往越有可能超越有限样本,迁移到新的数据分布。

但一个基础问题始终没有令人满意的答案:对于现代深度神经网络,我们究竟该如何定义并测量“简单”?

参数范数、损失面的 sharpness、Jacobian 范数、线性区域数量、压缩长度……已有研究提出了不少候选指标,但往往难以同时做到三点:

  1. 通用性(generality):不依赖某一种特定网络架构或任务;
  2. 可量化(quantifiable):能在真实规模的已训练模型上稳定计算;
  3. 可优化(optimizable):不仅能事后评价模型,还能通过梯度直接参与训练。

千诀-清华团队尝试给出一个同时满足上述要求的答案。

他们提出了一种多项式表征(polynomial representations)方法:

  • 用数据点之间的插值路径“切开”高维神经网络,并以正交多项式近似网络沿路径的行为;
  • 用多项式表征的有效阶(effective degree,ED)衡量神经函数的简单性;
  • 将 ED 进一步变成可微的正则项,实现对神经函数复杂度的在线优化。

实验中,ED 不只是一个事后分析指标:在多个benchmark上,ED 都可以相当精确地预测出模型的实际generalization gap;在对神经网络 grokking 现象的分析中,ED 也呈现出比参数范数、sharpness 等指标更稳定的信号。更进一步,由于整个度量过程可微,研究团队还将 ED 写入训练目标,在图像、文本、视觉-语言模型和强化学习任务中直接优化模型的函数复杂度,并由此带来泛化性能的提升。

论文标题:Quantifying and Optimizing Simplicity via Polynomial Representations

论文作者:章天任、李向欣、肖明昊、陈冠宇、陈峰

论文地址:https://arxiv.org/abs/2605.29823

代码地址:https://github.com/xinzaixinzai/Effective-Degree

01.

“简单” 为什么难以测量?

衡量神经网络复杂度的一种常见思路是观察参数空间。例如,参数范数越小,或者局部损失面越平坦(也即sharpness越小),模型也许就越简单。

但参数并不等于函数。同一个函数可以由尺度和参数化方式截然不同的权重实现;即便网络输出完全不变,一次重参数化也可能显著改变参数范数或 sharpness。换言之,这些指标有时反映的是模型“如何被写出来”,而不一定是模型实现的函数本身有多复杂。

另一种更直接的思路,是在函数空间里定义复杂度。线性函数通常比二次函数简单,二次函数又比高阶振荡函数简单,因此按多项式次数衡量非线性程度十分自然。

然而,现代神经网络往往是从高维输入到高维输出的黑盒函数。如果直接在原始空间拟合多元多项式,基函数数量会随维度和阶数发生组合爆炸,在真实模型上几乎不可计算。

研究团队由此采用了一个降维视角:不试图一次看清整个高维函数,而是沿数据分布附近的许多一维路径观察它。

02.

沿数据路径,给高维神经网络做“函数切片”

给定从数据分布中采样的两个样本 x₁、x₂,团队在二者之间构造插值路径:x(α) = αx₁ + (1-α)x₂,α ∈ [0,1]

对于神经网络 f,模型沿这条路径的输出就变成了一个关于单变量 α 的函数。一个原本高维且复杂的神经函数,由此转化为许多条一维的“函数切片”。

接下来,团队使用 Chebyshev 正交多项式近似每条路径上的模型行为。如果模型输出沿路径接近线性变化,能量会集中在低阶系数上;如果输出频繁振荡,就需要更多高阶项才能描述。

一个自然的问题是:把高维函数限制到一维路径,会不会破坏原有的复杂度排序?论文给出的理论结果显示:对于多元多项式,只要插值方向来自具有密度的数据分布,随机路径几乎必然保留其代数阶;也即,对多条路径取平均后,不同阶多项式的复杂度顺序仍能被正确区分。

在实际计算中,研究团队还加入了三项设计:使用数据相关路径,将测量集中在真实数据分布附近;使用 Chebyshev 正交多项式基和余弦采样,缓解高阶拟合的数值不稳定;对于高维输出,可沿每条路径使用 PCA,只保留主要变化方向再进行拟合。

03.

有效阶:不只看“最高几阶”,还看每一阶有多重要

严格的代数阶只取决于最高阶非零系数。即使某个高阶项系数小到几乎可以忽略,函数仍会被判定为“高阶”,这使它对数值噪声和真实神经网络中的微小扰动非常敏感。

为此,论文定义了多项式表征的有效阶 ED:它可以被理解为“各阶成分按系数幅度加权后的平均复杂度”。低阶成分占主导时,ED 较小;高阶成分越多、幅度越大,ED 就越高。与只看最高非零阶不同,ED 关于拟合系数是连续且稳定的。最后,对从数据分布中采样的多条路径取平均,即可得到整个神经网络的复杂度估计。



【图 1:多项式表征方法总览。沿真实数据点之间的插值路径观察神经函数,以正交多项式拟合每条路径上的输出,并根据不同阶次的系数计算函数复杂度 ED。】

ED 的定义有两个关键特征。第一,它位于函数空间,不直接依赖模型如何参数化;第二,它与数据分布相关,因此衡量的实际上是模型在真实数据附近表现出的复杂度,这也符合模型实际使用场景的需要。

04.

ED 能预测泛化吗?

团队首先把 ED 作为训练后的评价指标,与参数范数、sharpness 和 adaptive sharpness 等现有的常用 generalization proxy 进行比较。

在 CIFAR-10 上,他们使用 27 组不同超参数分别训练 ResNet18 和 ViT-Tiny。对于 ResNet18,ED 与 generalization gap 的 Pearson 相关系数达到0.99,线性拟合 R² 达到0.98。相比之下,表现最好的 sharpness 指标相关系数为 0.94,R² 为 0.88。也就是说,模型在数据路径上的高阶成分越多,训练集与测试集之间的差距往往也越大。



【图 2:ResNet18 在 CIFAR-10 上的结果。相比 sharpness、adaptive sharpness 与参数 L2 范数,ED 与 generalization gap 呈现出最强的线性相关性。】

在 CLIP ViT 的 ImageNet 微调实验中,ED 同样与泛化间隙保持稳定正相关;sharpness、adaptive sharpness 和参数范数在这一设置下则表现出较弱、甚至方向相反的相关性。这也侧面印证了基于参数空间而非函数空间的泛化界度量的不鲁棒性。



【图 3:CLIP ViT 在 ImageNet 上的结果。ED 与 generalization gap 保持正相关,而其他指标在这一设置下呈负相关。】

ED 还能揭示同一个模型在训练过程中的复杂度变化。在经典的神经网络 grokking 现象中,模型通常先记住训练集,经过很长时间后才突然获得泛化能力。实验显示,ED 在记忆阶段逐渐升高,在验证损失开始骤降的转折点附近达到峰值,随后随着泛化形成而下降。参数范数在整个过程中单调增大,sharpness 也没有清晰地标出这一相变。



【图 4:Grokking 实验结果。只有 ED 可以捕捉到模型在训练过程中从记忆到泛化的相变。】

这意味着,ED 不仅可以比较不同模型在训练完成后的复杂度和泛化界,还可能追踪一个模型在训练过程中如何从“记忆样本”转向“归纳规律”。

05.

从测量简单性到优化简单性

如果 ED 只能作为一个模型复杂度评估指标,它仍然只是一个分析工具。论文更进一步指出,由于多项式拟合本质上是一个最小二乘问题,拟合系数对网络输出具有解析梯度,因此 ED 可以自然地穿过拟合过程,反向传播到模型参数。

研究团队由此将 ED 作为显式正则项加入原任务目标。它并不强迫模型沿插值路径严格线性,也不要求人为给插值样本指定“正确标签”;它只是惩罚不必要的高阶变化,让模型在完成原任务的同时,优先选择相对简单的函数。

实验覆盖了图像与文本监督分类、视觉-语言模型微调和强化学习等场景。在 CLIP 微调中,加入 ED 正则的模型在分布内准确率与平均分布外准确率的权衡上整体优于标准微调;在多个强化学习环境中,ED 正则也带来了更好的训练表现。



【图 5:ED 正则化在强化学习任务上的表现。】

06.

“简单”未必等于“正确”

论文也明确讨论了方法的边界:“越简单越好”并非无条件成立。

如果数据中最简单的特征恰好是一个不稳健的 shortcut,ED 可能与普通模型一样优先利用它。ED 描述的是函数复杂度,并不等同于正确性、语义合理性或公平性。如何让“简单”与正确的归纳偏置对齐,仍需要数据、任务目标和模型架构共同参与。

此外,路径多项式只是高维函数的一种分布相关代理;训练时采样额外插值点,也会带来一定计算开销。

07.

总结

千诀-清华团队的研究工作给出了一个从函数空间理解神经网络的新工具:在表征层面,用数据相关路径上的正交多项式紧凑描述高维神经函数;在度量层面,用有效阶稳定量化高阶成分,并预测模型的泛化行为;在优化层面,通过可微的多项式拟合,使得模型的复杂度或简单性可以被在线优化。

从更广泛的视角看,多项式表征在理论与实践之间搭起了一座桥:理论上,模型的低阶偏置可以帮助研究者分析神经网络为何可能学到世界模型;实践中,“有效阶”让这种偏好也可以被测量和干预。

由此也产生了一系列值得继续追问的问题:不同架构和优化器会形成怎样的 ED 动态?ED 能否用于选择预训练 checkpoint、诊断微调过拟合,或设计更适合世界模型的自监督任务?除了多项式次数,是否还存在其他同时具备通用性、可计算性与可微性的函数空间表征?

参考文献

[1] Zhang, T., Li, X., Xiao, M., Chen, G., & Chen, F. Quantifying and Optimizing Simplicity via Polynomial Representations. ICML, 2026. https://arxiv.org/abs/2605.29823

[2] Zhang, T., Chen, G., & Chen, F. When Do Neural Networks Learn World Models? ICML, 2025. https://arxiv.org/abs/2502.09297

[3] Klindt, D., LeCun, Y., & Balestriero, R. When Does LeJEPA Learn a World Model? arXiv preprint, 2026. https://arxiv.org/abs/2605.26379

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
不打也不放开封锁和制裁,美国欲困死伊朗革命卫队?

不打也不放开封锁和制裁,美国欲困死伊朗革命卫队?

高博新视野
2026-08-11 19:26:42
4 家医院拒诊!腹痛患儿连跑 5 家医院!一场医疗事件的影响有多大?这个国家一代儿科医生出走!儿科年年亏损,医疗服务提价有用么?

4 家医院拒诊!腹痛患儿连跑 5 家医院!一场医疗事件的影响有多大?这个国家一代儿科医生出走!儿科年年亏损,医疗服务提价有用么?

梅斯医学
2026-08-11 07:53:23
日本歌手嫁给黑人男子,晒一家三口合照遭狂喷!日网友:歧视是理所当然的!

日本歌手嫁给黑人男子,晒一家三口合照遭狂喷!日网友:歧视是理所当然的!

东京新青年
2026-08-12 19:33:08
缺席审判,阿萨德被判死刑!

缺席审判,阿萨德被判死刑!

每日经济新闻
2026-08-11 19:16:07
1942年日军在华北修了上万座炮楼,荒山野岭根本接不上电线,油料也十分紧缺,日军当年想出的这套供电法子,很多人听了都觉得意外

1942年日军在华北修了上万座炮楼,荒山野岭根本接不上电线,油料也十分紧缺,日军当年想出的这套供电法子,很多人听了都觉得意外

磊子讲史
2026-08-11 11:09:43
胖东来许昌店关闭引争议!网友:房东挺冤的,就是没有管理失误也会搬,因为商场有硬伤,没有地下停车场

胖东来许昌店关闭引争议!网友:房东挺冤的,就是没有管理失误也会搬,因为商场有硬伤,没有地下停车场

火山詩话
2026-08-10 10:24:26
全都看走眼了!本西蒙斯解锁跳投,勇士捡漏?最大黑马要诞生了

全都看走眼了!本西蒙斯解锁跳投,勇士捡漏?最大黑马要诞生了

体育大朋说
2026-08-12 13:10:17
字节AI,不装了:收税12%、不蒸馏、赌5万亿

字节AI,不装了:收税12%、不蒸馏、赌5万亿

钛媒体APP
2026-08-11 18:40:26
武大靖执掌短道国家队众望所归,对归化选手林孝埈刘少昂态度成焦点

武大靖执掌短道国家队众望所归,对归化选手林孝埈刘少昂态度成焦点

杨华评论
2026-08-12 17:11:44
程梦圆事件后续!她的家属,给找到背包和身份证的白大爷送了一面锦旗,网友:给个红包最实际

程梦圆事件后续!她的家属,给找到背包和身份证的白大爷送了一面锦旗,网友:给个红包最实际

火山詩话
2026-08-12 06:12:27
昔日国乒名将陈龙灿发声!张本宇留日另有原因,当年选择不简单

昔日国乒名将陈龙灿发声!张本宇留日另有原因,当年选择不简单

探源历史
2026-08-12 14:25:02
1976巨震,三位元勋陨落,为何都在这一年?

1976巨震,三位元勋陨落,为何都在这一年?

纪史行者
2026-08-10 21:18:19
92硕士也被裁?常州一企业疑裁400余名校招应届生,7月刚交社保,痛失应届生身份

92硕士也被裁?常州一企业疑裁400余名校招应届生,7月刚交社保,痛失应届生身份

趣笔谈
2026-08-12 11:53:24
多家法媒:摩纳哥决定和博格巴解约,并将支付其剩余工资

多家法媒:摩纳哥决定和博格巴解约,并将支付其剩余工资

懂球帝
2026-08-12 01:28:03
韩旭:为什么说近些年司法进步不容乐观?

韩旭:为什么说近些年司法进步不容乐观?

天下说法
2026-08-11 09:11:44
两千万人倒下,换的不是某套制度,而是"站着活"的权利?

两千万人倒下,换的不是某套制度,而是"站着活"的权利?

你在偷看谁
2026-08-12 20:01:53
触目惊心!南太行22岁程梦圆坠亡,多张现场图复盘:她离张良庙的平地非常近了

触目惊心!南太行22岁程梦圆坠亡,多张现场图复盘:她离张良庙的平地非常近了

火山詩话
2026-08-11 12:01:11
油价大跌“超1.57元/升”,连降3次的油价,8月14日或再大降,今年第5次“超500元/吨”大跌中!

油价大跌“超1.57元/升”,连降3次的油价,8月14日或再大降,今年第5次“超500元/吨”大跌中!

油价早知道
2026-08-10 08:56:36
赵一鸣4块牛肉干64元,复称仅17元。老板说“系统问题”,顾客说“每样都多称了”

赵一鸣4块牛肉干64元,复称仅17元。老板说“系统问题”,顾客说“每样都多称了”

听心堂
2026-08-11 21:39:10
弘一法师:当你的福报开始变大,身边的人会渐渐离开,原因很现实

弘一法师:当你的福报开始变大,身边的人会渐渐离开,原因很现实

牛锅巴小钒
2026-08-10 14:01:26
2026-08-12 23:24:49
机器人大讲堂 incentive-icons
机器人大讲堂
立德机器人平台,是一个集媒体品牌、智库咨询、投资孵化、引智招商为一体的机器人垂直领域服务平台
6931文章数 4598关注度
往期回顾 全部

科技要闻

Manus第二季,浪子回头

头条要闻

业主称天然气公司要求热水器满8年必须换 不换不能购气

头条要闻

业主称天然气公司要求热水器满8年必须换 不换不能购气

体育要闻

杜兰特,所谓的“联盟小王”

娱乐要闻

老戏骨杨昆两夺金鹰奖,因物业费被告

财经要闻

华尔街把AI算力炒成下一个房地产?

汽车要闻

这台大众不一般 上汽大众ID.ERA.5S综合续航约2000公里

态度原创

教育
艺术
数码
亲子
公开课

教育要闻

山西2027年中考总分调整:850分降至720分

艺术要闻

郭润文的人物油画,附2026新作

数码要闻

内存狂涨推高老旧处理器销量 旧型号倒反天罡力压旗舰

亲子要闻

快来跟我一起上声乐课吧~ #vlog日常#少儿声乐#唱歌#彩虹糖裴曼伊

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版