[LG]《Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors》A Hägele, A Hernández-Cano, A Kosson, M Jaggi [EPFL] (2026)
在深度学习领域,标准优化器将权重矩阵视为整体,导致其幅值与方向的动态特性产生耦合。这种干扰使得方向更新的步长受控于当前的权重大小,而幅值则在旋转过程中被迫漂移增长。为了维持训练稳定,开发者不得不依赖权重衰减与预热等间接手段来抑制这种不可控的演化,本质原因是优化器缺乏对权重几何分量的直接调控。
本文的核心洞见是:将权重矩阵重新看作由极坐标构成的复合体。由此,将每个权重分解为超球面上固定范数的方向向量,以及可学习的行级与列级增益系数,并为两者分配独立的学习率。这一操作在优化器内部实现了逻辑解耦,使模型在保持单一融合张量形式的同时,能够直接通过学习率精准控制权重的旋转速度与缩放尺度。
这项工作真正留下的遗产是证明了幅值与方向的显式解耦能显著提升训练效率,在大型混合专家模型上仅需一半算力即可达到基准性能。它为后来者打开的新门是实现了跨模型宽度的学习率无缝迁移,消除了大规模训练中昂贵的调参成本,但尚未跨过的门槛是探明在受限球面空间内,如何设计比线性衰减更高效的非欧几里得调度策略。
arxiv.org/abs/2606.25971 #机器学习##人工智能##论文##AI创造营#
发布于 北京
