爱可可-爱生活
26-01-04 06:08 微博认证:AI博主 2025微博新锐新知博主

[LG]《Training Deep Learning Models with Norm-Constrained LMOs》T Pethick, W Xie, K Antonakopoulos, Z Zhu... [EPFL] (2025)

长期以来,我们习惯于让优化器在训练过程中动态捕捉模型的几何特征,比如Adam。但如果神经网络的结构本身就是我们设计的,为什么不提前告诉优化器它的几何规则呢。

这篇来自EPFL的研究提出了Scion优化器。它通过线性最小化算子(LMO)将先验的几何知识直接注入训练过程。这不仅是一个算法的改进,更是一场关于优化哲学从在途适应向先验定义转型的深刻讨论。

优化器的盲区与先验的回归
主流优化器如Adam本质上是将神经网络视为黑盒,通过梯度反馈在训练中摸索参数空间的几何形状。然而,神经网络的层级结构是人为设计的。Scion的核心思想是:与其在黑暗中摸索几何特征,不如在设计之初就定义规则。通过引入基于范数约束的LMO,Scion实现了对模型权重的精确几何控制。

统一框架下的几何美学
研究者提出了一个名为uSCG(无约束随机条件梯度)的算法家族。令人惊讶的是,原本用于约束优化的LMO被成功应用于无约束问题。这个框架极具包容性:当你选择不同的范数时,它能退化为SignSGD、Normalized SGD甚至最近火热的Muon。这种统一性揭示了优化算法背后共同的几何本质。

深度架构的范数定制化
Scion并不对所有层一视同仁,而是根据数据流的几何特性为不同层量身定制范数:
- 输入层:采用列范数(ColNorm),完美适配One-hot编码。
- 隐藏层:采用谱范数(Spectral Norm),确保特征在层间传递时不缩放、不爆炸。
- 输出层:采用Sign算子,优化分类决策边界。
这种因地制宜的策略,让每一层参数都能在最自然的几何空间内演进。

跨越规模的超参数迁移
对于大模型训练而言,调参是极其昂贵的。Scion展现了令人惊叹的零样本超参数迁移能力。由于其更新规则在数学上确保了特征学习的宽度不变性,你在小模型上调优的步长,可以直接应用到3B甚至更大规模的模型上。真正的通用性,是让算法的节奏不随模型规模的膨胀而乱序。

极致的内存与性能表现
在nanoGPT的训练实验中,Scion在完全不依赖Adam的情况下实现了显著的加速。更重要的是,它极其节省内存:仅需存储一组模型权重和一组梯度,且支持半精度存储。在处理大批量训练时,Scion表现出了比传统算法更强的鲁棒性,有效降低了对噪声的敏感度。

深度思考:从适应到尊重
Scion的成功给了我们一个启示:深度学习的未来,或许不在于设计更复杂的反馈机制,而在于对模型固有几何结构的深刻尊重。当优化器理解了权重的物理意义,训练就不再是盲目的随机碰撞,而是一场精准的几何重构。

优化不应是与混乱的博弈,而应是对结构的顺应。

arxiv.org/abs/2502.07529

发布于 北京