早于LeCun相似研究一年!千诀科技联合清华团队让神经网络「简单性」可测可优化
千诀科技联合清华大学团队,为神经网络提出了一把新的 “复杂度标尺”。
随着模型训练数据量的增大,我们有越来越多的 benchmark 可以用于评价一个模型答得准不准,却很难判断它究竟学到了可迁移的规律,还是用复杂方式 “记住” 了训练数据。团队提出的 “有效阶”(Effective Degree,ED),首次将这项研究路线中抽象的 “简单性偏置”,转化为一个能在真实规模模型上计算、比较并直接参与训练的指标。
这项研究不仅为理解神经网络为什么能够泛化提供了新工具,未来还有望用于筛选预训练模型、诊断微调过拟合,并改善视觉、语言、强化学习及世界模型面对新数据和新环境时的表现。
值得关注的是,这条研究路线与图灵奖得主 Yann LeCun 团队近期受到关注的世界模型理论形成了呼应,而千诀科技与清华团队对相似方法论视角的公开研究,比 LeCun 团队早约一年。
今年 5 月, Yann LeCun 与 David Klindt、Randall Balestriero 的论文《When Does LeJEPA Learn a World Model?》一经发布便获得广泛关注。论文从隐变量可辨识性的角度研究 LeJEPA 驱动的世界模型,并用 Hermite 多项式将高斯世界中的函数按非线性次数分解:非线性阶数越高,在 LeJEPA 的 alignment 目标下受到的惩罚越强,因此线性恢复真实隐变量成为最优解。
值得注意的是,早在一年前,清华大学自动化系陈峰教授和千诀科技的联合团队(第一作者章天任)就在 ICML 2025 论文《When Do Neural Networks Learn World Models?》中采用了相近的方法论视角:将 “学习世界模型” 形式化为对数据生成隐变量的恢复(辨识)问题,并通过正交函数基将复杂函数分解为不同阶次,研究神经网络在解空间的低阶偏置如何促使真实隐变量变得可辨识。
两项研究使用的数学工具并不完全相同:千诀 - 清华团队研究多任务学习设定下具有低阶偏好的神经网络模型,使用 Fourier-Walsh 变换分析离散布尔世界;LeCun 等人研究 LeJEPA 及带平稳动力学的高斯世界,使用 Hermite 多项式进行谱分解。但二者尝试回答的关键问题和技术路径又是相似的: 从隐变量可辨识性出发,用函数的阶次刻画 “简单性”,再借助训练目标对低阶解的偏好,解释模型何时能够恢复世界的真实结构。
如今,千诀 - 清华团队又把这条理论线索向现实模型推进了一步。
在 ICML 2026《Quantifying and Optimizing Simplicity via Polynomial Representations》工作中,研究团队不再只问 “低阶偏好为何能帮助模型学到世界结构”,而是进一步追问: 这种偏好能不能在真实的 ResNet、ViT、语言模型和强化学习策略网络上被直接测量,甚至被主动优化?
他们给出的答案是 “有效阶”(Effective Degree,ED):沿真实数据点之间的插值路径观察高维神经网络,用正交多项式拟合模型输出,再根据不同阶次成分的权重计算函数复杂度。由此,“简单性偏置” 从团队上一项工作中的理论假设,变成了一个兼具通用性、可计算性和可微性的实用工具。
要理解 ED 解决了什么问题,还要回到深度学习中的一个经典谜题:为什么参数量远多于训练样本的神经网络,依然能在未见数据上表现良好?
一个广为接受的解释是 “简单性偏置”(simplicity bias):面对许多都能拟合训练数据的函数,神经网络及其训练过程并非随机选择,而是更倾向于学到相对简单的那个。类似奥卡姆剃刀,越简单的规律,往往越有可能超越有限样本,迁移到新的数据分布。
但一个基础问题始终没有令人满意的答案:对于现代深度神经网络,我们究竟该如何定义并测量 “简单”?
参数范数、损失面的 sharpness、Jacobian 范数、线性区域数量、压缩长度…… 已有研究提出了不少候选指标,但往往难以同时做到三点:
通用性(generality):不依赖某一种特定网络架构或任务;
可量化(quantifiable):能在真实规模的已训练模型上稳定计算;
可优化(optimizable):不仅能事后评价模型,还能通过梯度直接参与训练。
千诀 - 清华团队尝试给出一个同时满足上述要求的答案。
他们提出了一种多项式表征(polynomial representations)方法:
用数据点之间的插值路径 “切开” 高维神经网络,并以正交多项式近似网络沿路径的行为;
用多项式表征的有效阶(effective degree,ED)衡量神经函数的简单性;
将 ED 进一步变成可微的正则项,实现对神经函数复杂度的在线优化。
实验中,ED 不只是一个事后分析指标:在多个 benchmark 上,ED 都可以相当精确地预测出模型的实际 generalization gap;在对神经网络 grokking 现象的分析中,ED 也呈现出比参数范数、sharpness 等指标更稳定的信号。更进一步,由于整个度量过程可微,研究团队还将 ED 写入训练目标,在图像、文本、视觉 - 语言模型和强化学习任务中直接优化模型的函数复杂度,并由此带来泛化性能的提升。
论文标题:Quantifying and Optimizing Simplicity via Polynomial Representations
论文作者:章天任、李向欣、肖明昊、陈冠宇、陈峰
论文地址:https://arxiv.org/abs/2605.29823
代码地址:https://github.com/xinzaixinzai/Effective-Degree
“简单” 为什么难以测量?
衡量神经网络复杂度的一种常见思路是观察参数空间。例如,参数范数越小,或者局部损失面越平坦(也即 sharpness 越小),模型也许就越简单。
但参数并不等于函数。同一个函数可以由尺度和参数化方式截然不同的权重实现;即便网络输出完全不变,一次重参数化也可能显著改变参数范数或 sharpness。换言之,这些指标有时反映的是模型 “如何被写出来”,而不一定是模型实现的函数本身有多复杂。
另一种更直接的思路,是在函数空间里定义复杂度。线性函数通常比二次函数简单,二次函数又比高阶振荡函数简单,因此按多项式次数衡量非线性程度十分自然。
然而,现代神经网络往往是从高维输入到高维输出的黑盒函数。如果直接在原始空间拟合多元多项式,基函数数量会随维度和阶数发生组合爆炸,在真实模型上几乎不可计算。
研究团队由此采用了一个降维视角:不试图一次看清整个高维函数,而是沿数据分布附近的许多一维路径观察它。
沿数据路径,给高维神经网络做 “函数切片”
给定从数据分布中采样的两个样本 x₁、x₂,团队在二者之间构造插值路径:x (α) = αx₁ + (1-α) x₂,α ∈ [0,1]
对于神经网络 f,模型沿这条路径的输出就变成了一个关于单变量 α 的函数。一个原本高维且复杂的神经函数,由此转化为许多条一维的 “函数切片”。
接下来,团队使用 Chebyshev 正交多项式近似每条路径上的模型行为。如果模型输出沿路径接近线性变化,能量会集中在低阶系数上;如果输出频繁振荡,就需要更多高阶项才能描述。
一个自然的问题是:把高维函数限制到一维路径,会不会破坏原有的复杂度排序?论文给出的理论结果显示:对于多元多项式,只要插值方向来自具有密度的数据分布,随机路径几乎必然保留其代数阶;也即,对多条路径取平均后,不同阶多项式的复杂度顺序仍能被正确区分。
在实际计算中,研究团队还加入了三项设计:使用数据相关路径,将测量集中在真实数据分布附近;使用 Chebyshev 正交多项式基和余弦采样,缓解高阶拟合的数值不稳定;对于高维输出,可沿每条路径使用 PCA,只保留主要变化方向再进行拟合。
有效阶:不只看 “最高几阶”,还看每一阶有多重要
严格的代数阶只取决于最高阶非零系数。即使某个高阶项系数小到几乎可以忽略,函数仍会被判定为 “高阶”,这使它对数值噪声和真实神经网络中的微小扰动非常敏感。
为此,论文定义了多项式表征的有效阶 ED:它可以被理解为 “各阶成分按系数幅度加权后的平均复杂度”。低阶成分占主导时,ED 较小;高阶成分越多、幅度越大,ED 就越高。与只看最高非零阶不同,ED 关于拟合系数是连续且稳定的。最后,对从数据分布中采样的多条路径取平均,即可得到整个神经网络的复杂度估计。