IQuest给出大规模预训练新视角:早期收敛快不等于最终效果好,调度策略决定MuonH上限
IQuest Research团队 投稿
量子位 | 公众号 QbitAI
在大规模预训练中,优化器是一个非常重要的组件。近年来,以MuonH为代表的Hyperball优化器受到广泛关注:它将普通优化器训练中隐式形成的球面运动显式化,使研究者能够更加直接地控制模型参数方向的变化速度。
然而,实践上存在的一个核心问题是:在获得这种更清晰的角步长控制后,应该如何为MuonH配置与之匹配的学习率调度,才能真正发挥它的优势?
Hyperball训练中有个代表性现象,它在训练初期表现欠佳,但在中期或后期却会反超基线。问题也由之而来:如果Hyperball主要通过抑制径向更新来发挥作用,那么为什么这种抑制会产生阶段性的转变?反之,如果其主要作用是改变有效步长,那么是否仅通过调整学习率调度,就能让非Hyperball优化器表现出和Hyperball相同的行为效果呢?
至知创新研究院(IQuest Research)与合作伙伴组成的研究团队,对这些问题进行了深度拆解分析。
研究团队延续“角有效学习率”的概念,设计了一个有意思的实验:通过动态调整非Hyperball优化器(MuonWD)的学习率,使其每一步的角有效学习率与MuonH完全相同。实验结果显示,两者的训练动态可以被相互转换,这表明Hyperball的优势主要源于其隐式形成的有效学习率调度,而非更优的更新方向。
进一步的预训练实验表明,对MuonH采用更激进的学习率衰减虽可加速早期收敛,但可能损害最终性能,凸显了学习率调度的重要性。

从参数范数转向参数方向
对于带有归一化结构的深度网络,一部分参数具有尺度不变性:将参数整体放大或缩小,损失函数保持不变。在这种情况下,单纯改变参数的“长度”未必改变模型行为,参数方向的转动更适合描述模型在优化过程中真正发生了多大变化。
传统分析常用学习率除以参数范数,近似衡量有效学习率。这种方法通常隐含一个前提:参数与优化器给出的更新方向近似正交。
这一前提对原始梯度可能成立,但现代优化器通常还包含动量、预条件、正交化或其他矩阵变换。经过这些处理后,最终更新方向未必继续与当前参数正交。如果只考虑参数范数,可能遗漏更新方向和更新幅度带来的影响。
IQuest Research团队提出以连续两步参数状态之间的夹角作为角位移,衡量参数在每次更新中方向上的实际变化,并据此定义“角有效学习率”。
推导表明,模型每一步实际产生的方向变化,同时取决于外部学习率、参数范数、更新范数,以及参数与更新之间的夹角。
Hyperball究竟控制了什么
Hyperball同时约束参数范数和更新范数:首先将优化器生成的更新归一化到固定尺度,再将更新后的参数投影回以初始参数范数为半径的球面。经过这一处理,参数范数和更新范数均受到约束。
常规优化器的实际角步长会随参数范数增长和更新幅度变化而改变。Hyperball压缩了这两个独立变量的影响,使角有效学习率主要随外部学习率和参数—更新夹角演化。这一结构也对应着MuonH的典型训练现象:与MuonWD相比,MuonH早期收敛较慢,中后期又可能追上甚至超过前者。
这种阶段性变化究竟来自哪里?一种直观解释认为,Hyperball通过投影操作抑制了径向更新,从而改善训练。但径向更新的作用需要进一步拆开来看。
径向更新不是主要解释
优化器更新可以分解为两个部分:一个沿当前参数方向,称为径向分量;另一个与参数方向正交,称为切向分量。切向分量会直接转动参数方向。纯径向分量只会改变参数范数,本身不会产生角位移,但它可能通过改变参数范数、梯度尺度和优化器状态,对后续训练产生间接影响。
研究团队进一步把角度有效学习率的变化拆解为四个来源:外部学习率调度、参数—更新夹角变化、参数范数变化和更新范数变化。结果显示,参数—更新夹角在训练初期变化明显,随后进入缓慢变化的负值区间。在该项目考察的训练配置中,径向分量对当前角步长的直接贡献较小,整体趋势主要由外部学习率调度和参数范数演化主导。
这说明径向更新会影响单步角位移,也可能积累长期影响;但其直接作用不足以解释MuonH所呈现的“先慢后快”动态。

更像一种隐式学习率调度
在排除径向分量的直接作用后,团队把注意力转向有效步长。
在恒定基准学习率下,MuonWD的参数范数会随训练增长,其角有效学习率随之快速下降。MuonH固定参数范数并归一化更新,因此在初始瞬态结束后,可以维持近似恒定的角有效学习率。当基准学习率采用线性衰减时,MuonH的角有效学习率也近似按同样的轨迹衰减。
换言之,MuonH的有效步长与外部学习率调度之间保持着更加直接的对应关系。这使Hyperball可以被理解为一种隐式的、状态相关的学习率调度机制。它固定参数尺度和更新尺度,使模型在训练早期维持较大的角有效学习率。较大的有效步长可能延缓早期损失下降,却也可能让优化过程在后期到达不同区域。这与“前期较慢、后期追上”现象相吻合。
只改变学习率,能否复现Hyperball
为了进一步隔离变量,团队设计了学习率对齐实验。具体来说,团队保持优化器结构不变,只在每一步调整外部学习率,使MuonWD的角有效学习率与MuonH对齐。随后再反向进行实验,让MuonH的角有效学习率对齐MuonWD。
结果显示,只通过逐步调整学习率,两类优化器的损失轨迹就可以在相当程度上相互复现。这一结果支持了论文的核心判断:在当前实验条件下,Hyperball与普通优化器之间的主要差异,更可能来自有效步长随训练过程的演化。不过,现有结果尚不足以证明Hyperball会天然产生更优的更新方向。
加快早期收敛,也可能损害后期表现
既然MuonH在训练早期维持较大的有效学习率,研究团队随后尝试采用更激进的学习率衰减,让它更快进入收敛阶段。团队比较了线性衰减、指数衰减和多项式衰减。其中,power-0.4调度在3150步达到验证损失3.28;作为对照,MuonH-Z使用minus-square-root调度,在3175步达到同一目标。但较快的早期收敛没有稳定转化为更好的后期结果。实验显示,学习率衰减过于激进时,MuonH在训练后段可能落后于标准MuonWD,也可能落后于采用其他调度策略的MuonH。
固定参数范数和更新范数,可以减少尺度变化对实际步长的干扰,却无法直接降低学习率设计的复杂度。对于MuonH,外部学习率与实际角步长联系更紧密,调度策略也因此更加重要。因此研究团队认为,目前没有直接证据表明MuonH能在完整优化过程中持续优于MuonWD。
固定角速度之后,调度仍然关键
这项研究进一步明确了Hyperball类优化器的作用边界。Hyperball的核心价值未必在于持续产生优于基础优化器的更新方向,而在于提供一种更加稳定和可控的角步长机制。通过约束参数范数和更新范数,它减少了参数尺度扩张等状态变量对有效学习率的干扰,使更新方向和更新步长能够被更清晰地分开研究。
这种解耦本身具有重要意义。它不仅为学习率调度提供了更加直接的控制接口,也为研究scaling law、优化器几何性质,以及步长、方向和参数尺度之间的耦合关系,提供了更加纯粹的实验基础。
当前实验主要集中于稠密语言模型预训练,比较对象限于Muon、MuonWD和MuonH,评价也以验证损失和优化动态为主。相关规律能否推广到MoE架构、AdamW及其Hyperball版本,以及下游任务和模型泛化能力,仍有待进一步研究。
正如论文标题所表达的,“免费午餐”并不存在。MuonH提供了更稳定、更可控的角步长,但这种控制能力并不会自动转化为更优的训练结果。只有为它设计与其几何性质相匹配的学习率调度,才能真正释放Hyperball优化器的潜力。用原文的话来说:“Maintaining a constant angular velocity does not eliminate the learning-rate-scheduling problem; careful scheduling remains essential to realizing the potential of Hyperball-style optimizers.”
论文链接:https://arxiv.org/abs/2607.22444
Github链接:https://github.com/mangocrazz/hyperball-may-not-be-a-free-lunch
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🌟 点亮星标 🌟