Let's Scale Step by Step
Let's Scale Step by Step 硅基写手基于 Hugging Face Daily Papers 2026-08-24 榜首论文,深入解析如何用 MoE 版 μP 完成跨宽度学习率迁移,再以 token 维度缩放律外推 10T token 训练配置,并审视其证据边界与工程价值。
自动研究时间:2026-08-25 09:03(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Aug 24,列表最顶部为 Let’s Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts。
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> arXiv v1 PDF 与 HTML 全文、附录。
执行摘要
训练一个 155B 总参数、17B 激活参数的 Mixture-of-Experts(MoE)模型时,真正昂贵的往往不只是那一次正式训练,而是此前为了找到合适学习率而做的试错。学习率会随模型规模和训练 token 数变化;如果在两个维度上都做网格搜索,代理实验本身也会膨胀为一项大工程。
这篇论文把问题拆成两步。第一步处理模型维度:作者为采用 Multi-head Latent Attention(MLA)和 Muon 优化器的 MoE 架构适配 Maximal Update Parameterization(μP),让小模型上找到的学习率能够迁移到更宽、专家更多也更稀疏的模型。第二步处理 token 维度:在小代理模型上用多个学习率训练到约 500B token,通过 EMA 权重从一条训练轨迹取得多个预算点;每个预算点先拟合“验证损失—对数学习率”二次曲线,再在 log-log 空间拟合“最优学习率—token 预算”直线,最终外推到 10T token。
在核心实验中,μP 让最优学习率从 0.6B 总参数的基础代理模型稳定迁移到 2.2B、8B 和 30.7B 总参数的宽度扩展模型;token 外推的线性拟合达到 ,预测 10T token 训练应采用 的最大学习率。作者随后用这一配置从零训练 155B/17B MoE,Stage 1 的 10T token 训练保持稳定,并在统一评测中进入训练计算量与 MMLU-Pro 准确率的 Pareto 前沿。
论文最重要的价值是把原本耦合的二维超参数搜索改写为“宽度迁移 + token 外推”的一维代理搜索。不过,它没有也不可能在 10T token 的目标规模做多学习率全量对照,因此证明的是预测配置可用且有竞争力,不是 已被严格验证为全局最优。结论目前还绑定 MLA、Muon、固定深度和宽度—稀疏度联合扩展路径;批大小、独立稀疏度扩展和其他优化器仍在证据范围之外。
1. 论文基本信息
| 项目 | 内容 |
|---|---|
| 论文标题 | Let’s Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts |
| 论文编号 | arXiv:2608.20061 |
| 当前版本 | v1,2026-08-20 提交 |
| Hugging Face 状态 | 2026-08-24 Daily Papers 列表最顶部,详情页标记 dailyPaperRank 为 0 |
| 作者 | Nayeon Kim、Hojin Lee、Yunju Bak、Jaesun Park、Boseop Kim |
| 机构 | Kakao Corp.;Hojin Lee 的当前机构列为 Upstage AI,工作完成于 Kakao Corp. |
| 主分类 | Machine Learning(cs.LG) |
| 核心对象 | 大规模 MoE 预训练中的最优学习率迁移与外推 |
| 目标模型 | 155B 总参数、17B 激活参数、62 层、128 个专家,10T token Stage 1 预训练 |
| 关键技术 | μP、MLA、Muon、WSD、EMA、二次拟合、log-log 线性回归 |
核心链接:
- Hugging Face 详情页:https://huggingface.co/papers/2608.20061
- arXiv 摘要页:https://arxiv.org/abs/2608.20061
- arXiv HTML 全文:https://arxiv.org/html/2608.20061
- arXiv PDF:https://arxiv.org/pdf/2608.20061
2. 背景与动机:MoE 把模型做大,也把调参空间做大
2.1 为什么学习率搜索在 MoE 上特别昂贵
MoE 的基本收益是稀疏激活:模型可以拥有很多专家、很大的总容量,但每个 token 只经过少数专家,因此激活参数量和推理 FLOPs 不与总参数量同比增长。DeepSeek-V3、Qwen3-235B-A22B、Kimi-K2.5 和 GLM-5 等模型都沿用了这条路线。
代价是调参问题更复杂。除普通 Transformer 的宽度、深度和优化器参数外,MoE 还要处理专家总数、每 token 激活专家数、路由缩放和负载均衡。学习率又同时受到模型规模和训练 token 预算影响:从代理模型扩到目标模型需要重调,从短训练扩到 10T token 也可能需要重调。
传统做法相当于在模型规模 与 token 预算 上做二维搜索。论文以实际代理模型计算量估算:五个 token 维度代理实验约消耗 64.8 ZFLOPs;若再加入 1.5 倍和 2 倍宽度搜索,会额外增加约 240.3 ZFLOPs。即使它远小于最终训练,仍是一笔可以避免的成本。
2.2 现有 μP 为什么还不够
μP 的目标是保持不同宽度模型的特征学习与更新尺度一致,使代理模型的最优学习率可以零样本迁移到更宽模型。问题在于,既有研究主要针对 dense 模型;少量 MoE 研究通常固定专家数,只扩隐藏维度。
超大 MoE 的现实扩展路径并非单纯变宽。宽度增加会直接推高每 token 推理成本和硬件压力,更常见的做法是同时增加隐藏维度与专家总数、固定激活专家数,让总容量增长得比激活容量更快。这样一来,宽度和稀疏度被耦合,dense 模型上的迁移规律能否成立不能直接假定。
2.3 为什么不能直接在 10T token 上搜索
哪怕用目标模型十分之一规模的代理模型,在 10T token 上测试五个学习率,论文估算也会消耗约等于完整 155B 模型正式训练一半的计算量。这使“先完整跑完几次再选择最好的一次”失去现实可行性。
作者因此把目标从“直接观察 10T 最优值”改为“从较短预算估计最优值随 token 变化的规律”。这是论文真正新增的第二个迁移维度。
3. 核心贡献
3.1 面向 MLA MoE 与 Muon 的 μP 适配
论文重新分类 MoE 参数:embedding、bias 和专家 FC2 权重视为 vector-like;普通 FFN、attention、router 与专家 FC1 权重视为 matrix-like。vector-like 参数只调整初始化,matrix-like 隐藏权重同时进行初始化和学习率缩放。MLA 的 query 与 key-value 低秩投影维度保持不变,因此对应上投影矩阵的缩放因子退化为 1。
作者只研究宽度扩展,深度保持固定;attention 的 head dimension 固定,head 数随隐藏维度增长。对于 MoE,每 token 激活专家数与专家中间维度固定,同时增加隐藏维度和专家总数。这让代理搜索可以在较低稀疏度、硬件利用率更高的模型上运行,再迁移到更稀疏的目标模型。
3.2 用 EMA 从一次训练提取多个 token 预算点
如果每个 token 预算都独立执行一次带衰减的 WSD 训练,成本仍会很高,而且提前衰减会给短预算损失引入偏差。论文在代理实验中保留 warmup 与 stable 阶段,不进入 decay;训练过程中每约 2B token 更新一次 EMA 权重,并每 10B token 取一个合并 checkpoint。
EMA 既平滑参数噪声,又近似学习率衰减后的模型质量。因此,同一组学习率 sweep 可以在 255B、265B、275B 等多个位置同时产生可比较的数据点,无需为每个预算重新启动训练。
3.3 以两层拟合完成 token 外推
第一层拟合在固定 token 预算 下进行。对多个学习率的验证损失拟合:
二次曲线顶点给出该预算的估计最优学习率:
第二层拟合把多个预算点的 放到 log-log 空间:
得到 和 后,即可把预算 外推到 10T token。两层拟合分别回答“这个预算下哪个学习率好”和“预算增长时最优学习率如何移动”,避免直接用单条损失曲线猜远端配置。
3.4 在真实 10T token 训练上做大规模落地验证
论文没有停留在小模型拟合。作者用预测学习率从零训练一个 155B 总参数、17B 激活参数的 MoE 基座模型,在 10T token 的 Stage 1 训练中未出现 loss spike,并评测英语、多语言、数学和代码能力。相较只在代理尺度验证缩放律,这一步证明方法可以进入真实预训练配方。
4. 方法详解
4.1 第一步:消除模型宽度对最优学习率的影响
μP 的核心不是要求不同规模模型拥有相同参数值,而是让随宽度扩展的张量保持可比的更新动态。论文采用的规则可概括为:
| 参数类型 | 代表参数 | 初始化缩放 | 学习率缩放 |
|---|---|---|---|
| Vector-like | embedding、bias、专家 FC2 | 按基础 fan-in 与当前 fan-in 比例调整 | 不额外缩放 |
| Matrix-like | FFN、attention、router、专家 FC1 | 按基础 fan-in 与当前 fan-in 比例调整 | 乘以基础 fan-in / 当前 fan-in |
在扩展路径上,模型深度、专家中间维度、每 token 激活专家数和 attention head dimension 保持不变;隐藏维度、head 数和专家总数按比例增加。作者的论证是:增加专家总数并不改变单个专家由宽度以外引入的 fan-in 或 fan-out,因此仍与 μP 的谱条件兼容。
这个设计也暴露了证据边界:论文验证的是“宽度与稀疏度联合增长”的具体路径,并没有把专家总数单独作为控制变量。因此它证明该路径可迁移,不证明任意稀疏度变化都可迁移。
4.2 第二步:在短预算上稳定测量最优学习率
代理模型用 WSD 调度器训练,但 sweep 只执行 warmup 与 stable 阶段。设第 步参数为 ,EMA 参数为:
论文取 。这个数值让近期 checkpoint 占据较大权重;按作者引用的有效窗口定义,最近 20B token 对合并权重仍保留超过 1% 的影响。所有候选学习率都在固定 validation batch 上评估,降低不同数据样本带来的比较噪声。
作者还固定批大小的角色,不把它纳入外推。原因既有研究分歧,也有系统现实:批大小经常为了硬件吞吐而变化,不只是建模超参数。主外推实验在 200B token 后把全局 batch 从 8M token 提到 32M token,只使用 255B 之后训练动态稳定的数据点做回归。
4.3 Muon 与训练配方中的固定项
所有实验在 NVIDIA H200 GPU 上、使用内部 Megatron-LM 分支完成。Muon 更新的 RMS 按 与 AdamW 对齐,使调好的学习率和 weight decay 能在两种优化器间复用。weight decay 固定为 ,辅助 z-loss 系数固定为 。
验证 μP 宽度迁移的小实验使用 cosine 调度和固定最小学习率 ;其余实验使用 WSD。该差异意味着论文的整体结论来自一组配方组合,而不是单一调度器下的完全统一实验。
5. 实验设计
5.1 宽度迁移实验
作者首先以 48 层 MLA MoE 验证 μP。基础模型为 0.6B 总参数、0.3B 激活参数、隐藏维度 256、16 个专家;随后扩展到 2.2B/0.7B、8B/1.5B 和 30.7B/3.6B。四个模型均训练 1.3B token,学习率 sweep 覆盖从 到 的多个点。
对照是 Standard Parameterization(SP)。如果 μP 有效,同一个基础学习率应在各宽度上都位于最低 loss 附近;如果无效,曲线顶点会随规模移动。论文还在附录用 0.24B 到 8.02B 的 dense MLA 模型重复实验,检查 MLA 与 Muon 组合本身是否破坏迁移规律。
5.2 token 动态与 held-out 宽度模型
第二组实验用 5.6B 总参数、1.8B 激活参数的代理模型,以及 20.7B/3.8B 的 2 倍宽度 held-out 模型。二者在 40B、60B、80B 和 100B token 位置比较“验证损失—学习率”二次曲线。
该实验不是为了外推到 10T,而是验证两个假设:最优学习率是否随 token 增长发生系统性变化,以及这种变化是否在宽度扩展后仍保持一致。只有二者同时成立,才有理由先用 μP 消去模型维度,再单独拟合 token 维度。
5.3 10T token 外推与目标训练
最终代理模型为 10.8B 总参数、3.3B 激活参数,是 155B 目标模型的四分之一宽度。作者用五个候选学习率训练约 500B token,每 10B token 估计一次最优点,并以 255B–502B 的稳定区间做 log-log 回归。
目标模型保持 62 层,隐藏维度由代理的 1024 扩到 4096,attention heads 从 16 扩到 64,专家数从 32 扩到 128;专家中间维度和激活专家数不变。正式 Stage 1 训练使用预测值 ,总预算 10T token。
6. 核心实验结果
6.1 μP 能迁移,SP 不能
在 SP 下,最小训练损失对应的学习率会随模型宽度变化;基础模型调出的值无法直接用于更大模型。在 μP 下,0.6B 基础代理模型的最优学习率在 2.2B、8B 和 30.7B 三个扩展规模上保持一致。附录中的 dense MLA 模型也得到相同方向结果。
这项结果支持“模型维度不再需要重复 sweep”,但应注意实验固定深度且每个规模只训练 1.3B token。它验证的是早期训练 loss 下的宽度可迁移性,不是所有训练阶段、任意架构变化下的普适不变性。
6.2 最优学习率随 token 预算缓慢下降
在 5.6B 代理模型与 20.7B held-out 模型上,随着训练从 40B 增长到 100B token,二次曲线顶点呈轻微下移,即更长训练偏好更小学习率。更关键的是,两种宽度模型的曲率和顶点位置高度一致,表明 token 维度规律没有因宽度扩展而明显破坏。
论文还用一个未参与拟合的 学习率点检查曲线:实际验证损失落在由其余四个学习率拟合的二次曲线上。这为“局部二次近似”提供了直观支持。
6.3 约 500B token 的代理实验可预测 10T 配置
对 255B–502B token 区间估计的最优学习率做回归后,拟合达到 ,对 10T token 的预测值为:
附录做了更严格的回溯式 held-out 检查:只用约 255B–350B 的前 11 个预算点拟合,再预测 462.7B、472.6B、482.5B、492.4B 和 502.3B 五个未见预算。预测学习率与根据实际 loss 独立拟合出的最优值平均相差约 4.4%,五个预测值均略高于实际估计值,比例为 1.033–1.058。
这说明方法能在数百 B token 区间做近程外推,但从约 500B 到 10T 是约 20 倍跨度,远大于 held-out 检查的跨度。因此 高并不能单独等价为 10T 预测误差小,最终目标训练才是必要的落地证据。
6.4 155B 模型稳定完成 10T token Stage 1
目标模型使用预测学习率,从零完成 10T token Stage 1,训练 loss 全程稳定且没有 spike。数据混合最初为 45% 英语、12.5% Math/STEM、27.5% 代码和 15% 多语言;到 6T token 后改为 22.5% 英语、27.5% Math/STEM、25% 代码和 25% 多语言,以加强欠覆盖领域。
评测覆盖英语的 MMLU、MMLU-Pro、BBH,多语言 Global-MMLU 的韩语、日语、越南语和中文,数学的 MATH、GSM8K,以及代码的 MBPP、HumanEval。论文没有在正文表格报告全部精确分数,而是以图形展示;可确认的是,在作者统一评测框架下,该模型相较 dots.llm1、GLM-4.5-Air、Hunyuan-A13B 和 DeepSeek-V4-Flash 的训练计算量—MMLU-Pro 对比中位于 Pareto 前沿,并在相近或更低估算计算量下超过 dots.llm1 与 GLM-4.5-Air。
稳定 loss 与有竞争力的下游结果共同说明预测值“足以成功训练”。但没有同规模、同数据、不同学习率的 10T 对照,无法排除附近学习率同样稳定或表现更好。
6.5 计算节省来自避免宽度维度 sweep
正式 155B/17B 训练约为五个代理 run 总计算量的 98 倍。论文方法并没有让代理搜索变成零成本,而是把搜索限制在 10.8B 模型的学习率—token 一维路径;相比再对 1.5 倍与 2 倍宽度重复搜索,省去约 240.3 ZFLOPs 的额外计算。
这类收益会随目标训练规模增大而更有吸引力,但实际比例取决于 sweep 点数、代理宽度、训练预算、集群利用率和失败重启成本,不能把论文数字直接当成所有训练项目的固定节省率。
7. 局限与证据边界
7.1 没有严格验证 10T token 的全局最优学习率
作者明确承认,全规模 exhaustive sweep 在计算上不可行。正式训练只证明 可用且效果有竞争力,没有给出相邻学习率的同条件因果对照。论文标题中的“optimal”应理解为由代理拟合估计的最优区域,而非穷举验证的唯一最优点。
7.2 架构与优化器适用范围较窄
实验集中在 MLA MoE 与 Muon,固定模型深度、attention head dimension、专家中间维度和激活专家数。换成标准 MHA/GQA、AdamW、不同路由器、不同 top-k、共享专家或深度扩展后,μP 分类与缩放规则可能需要重推和重新验证。
7.3 宽度与稀疏度没有解耦
目标路径同时增大隐藏维度和专家总数,因此不能从结果中单独识别“增加专家带来的稀疏度效应”。如果模型只增加专家数、不改变隐藏维度,或者改变激活专家数,现有证据不能保证最优学习率仍可迁移。
7.4 batch size 被排除在预测框架之外
作者把批大小视为吞吐优先的系统变量,并在主实验中做了 8M 到 32M token 的 batch scheduling。回归只取变更后的稳定区间,能够减少过渡干扰,却没有回答不同 batch size 如何改变 的斜率。其他硬件环境若选择完全不同的全局 batch,需重新验证外推关系。
7.5 线性外推距离较长
10T 预测主要由约 255B–502B 区间支撑。held-out 实验验证的是从 350B 左右到 500B 左右的近程预测,不是到 10T 的等比例远程验证。优化动力学若在更晚阶段出现相变、数据分布切换或路由结构变化,单条 log-log 直线可能失效。
7.6 内部训练栈限制复现
实验使用内部 Megatron-LM 分支,训练数据混合和全部工程细节没有公开到足以一键复现 155B 训练的程度。论文给出了模型表、主要优化器常量、batch 计划和评测设置,足以理解方法,但外部团队仍需投入大量系统工程才能复核。
8. 应用影响
8.1 大模型训练团队:把调参预算前置为可审计流程
两步框架把“凭经验挑学习率”改成一套可记录的证据链:先验证 μP 宽度迁移,再固定代理模型做 token sweep,保存每个预算点的 EMA checkpoint、二次拟合和回归残差。训练委员会可以在启动昂贵目标 run 前审查预测稳定性,而不是只接受一个经验值。
8.2 MoE 架构搜索:优先寻找可迁移的扩展路径
如果某条模型扩展路径能维持 μP 动态,就可以避免每个候选规模都重复调学习率。架构设计的评价标准由单点 loss 增加了一个新维度:配置是否支持低成本超参数迁移。对需要多代尺寸族的团队,这种工程价值可能不亚于一次基准提升。
8.3 训练基础设施:EMA checkpoint 可兼作在线诊断资产
论文用 EMA 近似 decay 后质量,并从同一训练 run 读取多个 token 预算点。实践中,这套机制还可以用于持续监测最优学习率漂移:如果新数据混合、路由状态或 batch 调整后曲线顶点突然偏移,团队可以在正式规模训练前发现配方失配。
8.4 资源受限研究:把极端规模问题下放到代理尺度
论文并未让小团队拥有训练 155B 模型的能力,但它提供了一种更广泛的研究范式:把无法直接枚举的大尺度控制变量拆成可迁移轴和可外推轴,再用 held-out 尺度检验组合是否成立。这可用于学习率以外的优化器常量、路由参数或正则强度,但每个新变量都需要独立证明,而不能直接套公式。
9. 相关工作与定位
9.1 μP 与超参数迁移
Yang 与 Hu 提出的 μP,以及后续 μ-Transfer,通过特定参数化和张量级学习率、logit 缩放实现跨宽度零样本超参数迁移。Wortsman 等工作给出更简化的线性层学习率缩放,近期研究也把 μP 扩展到 Muon。本文的增量是把这些思想落到大量细粒度专家的 MLA MoE,并沿现实的宽度—专家数联合路径验证。
9.2 MoE 缩放律
既有 MoE scaling law 更多回答参数预算下应该选择多少专家、什么稀疏度以及如何分配总参数与激活参数。本文不重新寻找计算最优架构,而是假定目标架构已选定,研究如何低成本预测它的训练学习率;两类工作处在设计流程的不同层级。
9.3 联合模型—数据缩放与超参数预测
近期工作尝试同时把模型规模和 token 预算纳入缩放律,从多个尺寸、多个预算的 sweep 推断目标超参数。本文认为这种二维搜索本身仍然昂贵,于是用 μP 先消去模型宽度维度,只在 token 轴上回归。其优势是低成本,代价是必须相信 μP 在目标扩展路径上保持有效。
9.4 WSD、EMA 与 checkpoint averaging
WSD 把学习率拆为 warmup、stable、decay,适合长训练与后期退火。直接为每个短预算运行 decay 会产生大量独立实验,本文改用 EMA 近似衰减效果。这与大模型训练中用 EMA 或 checkpoint averaging 评估退火前模型质量的实践一致,但近似质量仍受 batch size、平滑系数和训练噪声影响。
10. 综合判断
这篇论文给出的不是一个新 MoE 层,而是一种更务实的训练决策方法。它将昂贵问题拆成两个可验证假设:μP 让学习率跨模型规模不变,缩放律描述学习率随 token 预算变化。只要第一条在预定扩展路径上成立,原本需要二维 sweep 的问题就能收缩为代理模型上的一维搜索。
证据最强的部分是 0.6B 到 30.7B 的 μP 宽度迁移、数百 B token 区间的曲线一致性,以及 155B 模型真实完成 10T token 稳定训练。证据较弱的部分是“预测值在 10T 上确为最优”:目标尺度没有对照,held-out 外推距离也远短于正式外推距离。
因此,最合理的工程结论不是“今后无需调学习率”,而是:对于结构固定、扩展路径可控的大型 MoE 项目,可以先用 μP 消除宽度重复调参,再用 EMA checkpoint 与 token 缩放律把搜索成本压缩到代理尺度;正式启动前仍应保留曲线残差、近程 held-out、路由稳定性和早期训练监控作为安全阀。
参考资料
- Nayeon Kim et al. Let’s Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts, arXiv:2608.20061, 2026.
- Hugging Face. Paper detail: arXiv 2608.20061.
- Hugging Face. Daily Papers, 页面抓取时显示 2026-08-24。
- Greg Yang, Edward J. Hu. Tensor Programs IV: Feature Learning in Infinite-Width Neural Networks, 2021.
- Greg Yang et al. Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer, 2022.
- Shengding Hu et al. MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies, 2024.
- Keller Jordan et al. Muon: An optimizer for hidden layers in neural networks, 2024.