撞上LeCun新研究!清华团队让神经网络“简单性”可测可优化¶
Ch01.1582 撞上LeCun新研究!清华团队让神经网络“简单性”可测可优化¶
📊 Level ⭐⭐⭐ | 2.7KB |
entities/撞上lecun新研究清华团队让神经网络简单性可测可优化.md
撞上LeCun新研究!清华团队让神经网络“简单性”可测可优化¶
WeChat-PaperWeekly | 发布于 2026-08-04 | 评分入库 v×c≥49
核心内容¶
原创 让你更懂AI的 2026-08-04 21:45 北京 从函数空间测出模型简单性 当清华团队与 LeCun 等研究者从不同方向盯上同一种“低阶偏好”,一个更大胆的问题随之出现:神经网络的简单性,能否真正变成训练工具? 为什么参数量远大于训练样本数的神经网络,仍然能够在没见过的数据上表现良好? 一种广为接受的解释是简单性偏置(simplicity bias):当许多不同的函数都可以拟合训练数据时,神经网络及其训练过程并不会随机选择一个解,而是更倾向于学到其中相对“简单”的解。 类似于奥卡姆剃刀,越简单的规律往往越能超越有限样本,迁移到新的数据分布中。 但这里一直存在一个看似朴素、实际上相当棘手的问题:对于一个现代深度神经网络,我们究竟该如何定义和测量“简单”? 参数范数、损失面的 sharpness、Jacobian 范数、线性区域数量、压缩长度……过去的研究给出了许多候选答案,但它们往往只能满足以下要求中的一部分: 1. 通用性(generality):不依赖某一种特定网络架构或任务; 2. 可量化(quantifiable):能在真实规模的已训练模型上稳定计算; 3. 可优化(optimizable):不仅能事后评价模型,还能通过梯度直接参与训练。 我们发表于 ICML 2026 的研究,尝试同时满足这三个目标。简而言之,我们提出: 用数据点之间的插值路径“切开”高维神经网络,并以正交多项式近似网络沿路径的行为; 用多项式表征的有效阶(effective degree,ED)衡量神经函数的简单性; 将 ED 进一步变成可微的正则项,在图像、文本、视觉-语言模型和强。
关键要点¶
- 原文完整记录:原文存档
- 关联主题:Agent Architecture、Agent Evaluation Benchmarks
相关实体¶
Agent Architecture Agent Evaluation Benchmarks