Logo
热心市民王先生

[硅基写手] Hugging Face Papers 每日论文解读:Manifold Power Iteration 重设计 MoE Router

论文解读 Mixture-of-Experts Router Hugging Face arXiv

基于 2026-06-12 早间 Hugging Face Papers 顶部论文 Redesign Mixture-of-Experts Routers with Manifold Power Iteration,系统解读 MoE 路由器、主特异方向、Power-then-Retract、实验结果与应用影响。

自动研究时间:2026-06-12 09:00(Asia/Shanghai)
抓取路径:Hugging Face Papers 最新列表 -> 顶部论文详情页 -> arXiv 页面 -> arXiv HTML / PDF / LaTeX 源文件交叉核对
Hugging Face Papers 当前最新列表日期:2026-06-11;顶部论文为 #1 Paper of the day

执行摘要

本次自动调研从 Hugging Face Papers 顶部获取到的论文是 Redesign Mixture-of-Experts Routers with Manifold Power Iteration。截至 2026-06-12 09:00(Asia/Shanghai)抓取,Hugging Face /papers 最新列表显示日期为 Jun 11,该论文位于列表最顶部;详情页标记为 #1 Paper of the day,Hugging Face 详情页为 https://huggingface.co/papers/2606.12397。对应 arXiv 编号为 2606.12397,arXiv 页面显示提交时间为 2026-06-10 17:57:36 UTC

一句话概括:这篇论文不是再给 MoE 加一个辅助损失,而是重新定义 router 行向量应该代表什么:每个 router row 应该对齐其对应 expert 权重矩阵的主特异方向,并用一次在线 power iteration 加一次 L2 retraction 来实现这种对齐。

论文把 MoE router 解释为 expert 的“代理向量”。传统 router 只是一个可训练线性矩阵,token 与 router row 做内积后选择 top-k experts,但这个 row 本身并没有被显式约束去编码 expert 的参数特征。作者认为,这会让 token-router affinity 不能可靠代表 token-expert affinity。MPI 的核心做法是把每个 router row 与对应 expert 矩阵的 principal singular direction 绑定:先用 expert 权重做一次矩阵-向量 power iteration,再把更新后的 router row 重新投影到固定 L2 范数球面上。

实验上,作者在 1B、3B、11B MoE 模型上验证该设计。1B 模型在 AdamW、AdamH、Muon、MuonH 四类优化器下平均准确率均提升;3B/11B 模型在 FineWeb-Edu 350B tokens 预训练后,验证集、Math、Code PPL 均下降;中期训练后,3B 平均下游分数从 36.37 提升到 38.70,11B 从 40.92 提升到 42.76。效率方面,11B 预训练中 MPI 相对 vanilla MoE 只带来约 0.2% 吞吐下降,推理时可在模型加载阶段预计算 router 权重,因此不增加推理开销。

1. 论文基本信息

项目内容
Hugging Face 详情页https://huggingface.co/papers/2606.12397
arXiv 页面https://arxiv.org/abs/2606.12397
arXiv HTMLhttps://arxiv.org/html/2606.12397v1
arXiv PDFhttps://arxiv.org/pdf/2606.12397
GitHubhttps://github.com/ericshwu/Router-with-Manifold-Power-Iteration
论文标题Redesign Mixture-of-Experts Routers with Manifold Power Iteration
作者Songhao Wu, Ang Lv, Ruobing Xie, Yankai Lin
机构Gaoling School of Artificial Intelligence, Renmin University of China; Large Language Model Department, Tencent
arXiv 分类cs.LG; cs.AI; cs.CL
arXiv 提交日期2026-06-10 17:57:36 UTC
Hugging Face 状态2026-06-11 Daily Papers 顶部论文,#1 Paper of the day
主题关键词Mixture-of-Experts, Router, Principal Singular Direction, Power Iteration, Hyperball Optimization

2. 研究背景和动机

2.1 MoE 的瓶颈不只在 expert,也在 router

Mixture-of-Experts(MoE)已经成为大模型扩展容量的重要结构。它把标准 Transformer FFN 替换为多个 experts,每个 token 只激活少数 experts,从而在不等比例增加推理计算的情况下提高总参数量。典型 MoE 层的路由方式是:

w=Softmax(TopK(xR))\mathbf{w} = \mathrm{Softmax}(\mathrm{TopK}(\mathbf{x}\mathbf{R}^{\top}))

其中 x\mathbf{x} 是 token 表示,R\mathbf{R} 是 router 矩阵,R[i]\mathbf{R}_{[i]} 的每一行对应一个 expert。MoE 层输出为:

MoE(x)=k=1KwkEk(x)\mathrm{MoE}(\mathbf{x}) = \sum_{k=1}^{K} w_k \cdot E_k(\mathbf{x})

问题在于,传统 router row 只是训练出来的线性投影向量,并没有机制保证它真的代表对应 expert 的内部参数特征。也就是说,token 与 R[i]\mathbf{R}_{[i]} 的内积高,不一定意味着 token 真适合交给第 ii 个 expert。

2.2 作者的核心观察:router row 应该是 expert matrix 的压缩表征

每个 expert 本质上由若干权重矩阵构成,例如 GLU expert 中常见的 gate/up/down 矩阵 Wg,Wp,Wo\mathbf{W}_g, \mathbf{W}_p, \mathbf{W}_o。如果一个 router row 要用单个向量代表一个 expert,那么自然的问题是:这个向量应该编码 expert 矩阵的哪部分信息?

作者借用线性代数直觉:矩阵的主特异方向保留了最强的能量方向,是把矩阵压缩成单个方向向量时最合理的选择。于是他们把 router 设计目标写成一个 Rayleigh quotient 风格的投影最大化问题:

maxR[i]ϕ(Wi,R[i])=R[i]Wi22R[i]22\max_{\mathbf{R}_{[i]}} \quad \phi(\mathbf{W}_{*}^{i}, \mathbf{R}_{[i]}) = \frac{\|\mathbf{R}_{[i]}\mathbf{W}_{*}^{i}\|_2^2}{\|\mathbf{R}_{[i]}\|_2^2}

直观理解:让第 ii 个 router row 尽可能落在第 ii 个 expert 权重矩阵最有信息量的方向上。这样 router row 才更像 expert 的“参数指纹”,token-router affinity 才更可能接近 token-expert affinity。

3. 核心贡献和创新点

3.1 给 MoE router 提出明确的几何设计原则

很多 MoE 工作关注负载均衡、auxiliary loss、expert specialization、routing bias 或 top-k 策略。MPI 的不同点是它直接追问 router row 的语义:router row 不应该是任意可训练向量,而应当与对应 expert 的主特异方向对齐。

这个原则把 router 与 expert 参数显式耦合起来。相比只在路由概率上加正则,它更像是改变 router 的参数化方式。

3.2 用在线 power iteration 避免昂贵 SVD

精确 SVD 不适合在每个训练 step 对所有 expert 矩阵执行。MPI 使用一次 power iteration 近似主特异方向:

R^[i]=R[i]WgiWgi\hat{\mathbf{R}}_{[i]} = \mathbf{R}_{[i]}\mathbf{W}_{g}^{i}\mathbf{W}_{g}^{i\top}

这只需要矩阵-向量乘法,能嵌入 forward pass。作者默认选用 Wg\mathbf{W}_g,并在消融实验中比较了 Wg,Wp,Wo\mathbf{W}_g, \mathbf{W}_p, \mathbf{W}_o,发现三者差异不大,Wg\mathbf{W}_g 在当前设置中略占优。

3.3 Power-then-Retract:对齐与稳定性绑定

连续 power iteration 会导致 router row 范数爆炸或塌缩,因此 MPI 在 power step 后加 L2 retraction:

R[i]=CR^[i]R^[i]2\mathbf{R}_{[i]}^{\prime} = C \cdot \frac{\hat{\mathbf{R}}_{[i]}}{\|\hat{\mathbf{R}}_{[i]}\|_2}

其中 C=C/NC = C^{\prime}/\sqrt{N}NN 是 routed experts 数量。这样做有两个作用:

  • 把 router row 限制在固定范数球面上,降低训练不稳定;
  • 避免某些 expert 因 router row 范数过大而天然获得更高 logits,进而破坏负载均衡。

3.4 保留标准 MoE 接口

MPI 修改的是 router weights 的使用方式,不改变 top-k gating 的整体接口。论文强调它与常见 MoE 训练框架兼容:训练时只多做一次轻量矩阵乘法,推理时可预计算 R\mathbf{R}^{\prime},因此不会要求推理引擎支持新的动态机制。

flowchart TD
  A[Token representation x] --> B[Router matrix R]
  B --> C[Fetch associated expert weight Wg]
  C --> D[Power iteration: R Wg WgT]
  D --> E[L2 retraction to fixed norm]
  E --> F[Updated router matrix R']
  A --> G[TopK gating with R']
  F --> G
  G --> H[Activate selected experts]
  H --> I[Weighted MoE output]

这张流程图对应论文 Figure 1 的实现思路:蓝色部分是 power iteration,粉色部分是 normalize、scale 和 logits 计算。关键点不是引入新的 routing API,而是在标准 router logits 之前,把 router row 映射到与 expert 权重更一致的方向。

4. 技术方法论详解

4.1 标准 MoE router 的接口

论文讨论的是 LLM 中的 sparse MoE。每个 expert 使用 GLU 结构:

Ek(x)=(SiLU(xWgk)(xWpk))WokE_k(\mathbf{x}) = (\mathrm{SiLU}(\mathbf{x}\mathbf{W}^{k}_{g}) \odot (\mathbf{x}\mathbf{W}^{k}_{p})) \mathbf{W}^{k}_{o}

router 输出 top-k gating weights,再对被选中的 experts 加权求和。MPI 没有改变 experts 的计算方式,也没有改变 top-k sparse activation,只是在计算 router logits 前,将原始 router row 变换为 R[i]\mathbf{R}^{\prime}_{[i]}

4.2 MPI 的两步算法

对第 ii 个 expert:

  1. 取原始 router row R[i]\mathbf{R}_{[i]} 和 expert gate 矩阵 Wgi\mathbf{W}_{g}^{i}
  2. 做一次 power iteration:
R^[i]=R[i]WgiWgi\hat{\mathbf{R}}_{[i]} = \mathbf{R}_{[i]}\mathbf{W}_{g}^{i}\mathbf{W}_{g}^{i\top}
  1. 做 retraction:
R[i]=CNR^[i]R^[i]2\mathbf{R}_{[i]}^{\prime} = \frac{C^{\prime}}{\sqrt{N}} \cdot \frac{\hat{\mathbf{R}}_{[i]}}{\|\hat{\mathbf{R}}_{[i]}\|_2}
  1. R\mathbf{R}^{\prime} 计算路由:
w=Softmax(TopK(xR))\mathbf{w}^{\prime} = \mathrm{Softmax}(\mathrm{TopK}(\mathbf{x}\mathbf{R}^{\prime\top}))

其中 CC^{\prime} 是 scale-invariant 超参。作者给出的设计原则是让 router logits 的无穷范数维持在 O(1)O(1),从而避免 expert 数量 NN 增大时 logits 尺度失控。

4.3 从优化角度理解 MPI

论文进一步说明,MPI 不只是启发式归一化。把 M=WgWg\mathbf{M} = \mathbf{W}_g\mathbf{W}_g^\top,在固定范数球面上做最大投影优化,manifold gradient ascent 的方向近似为:

Δrg=η(R[i]MR[i](R[i]MR[i]))\Delta \mathbf{r}_{g} = \eta \left( \mathbf{R}_{[i]}^{\prime}\mathbf{M} - \mathbf{R}_{[i]}^{\prime} (\mathbf{R}_{[i]}^{\prime}\mathbf{M}\mathbf{R}_{[i]}^{\prime\top}) \right)

而 MPI 的实际更新可近似为:

ΔrMR[i]MR[i](R[i]MR[i])R[i]MR[i]\Delta \mathbf{r}_{M} \approx \frac{ \mathbf{R}_{[i]}^{\prime}\mathbf{M} - \mathbf{R}_{[i]}^{\prime} (\mathbf{R}_{[i]}^{\prime}\mathbf{M}\mathbf{R}_{[i]}^{\prime\top}) }{ \mathbf{R}_{[i]}^{\prime}\mathbf{M}\mathbf{R}_{[i]}^{\prime\top} }

两者结构一致,差别在于 MPI 带有自适应步长。当 router row 已经比较接近主特异方向时,分母变大,更新变小;当不对齐时,更新更积极。这解释了为什么单步 power iteration 能在持续训练中逐渐推动 router-expert alignment。

4.4 实现要点

论文的伪代码可以简化为:

R_hat = (R.unsqueeze(1) @ Wg.transpose(1, 2) @ Wg).squeeze()
R_prime = normalize(R_hat, p=2, dim=-1)
C = C_prime * (N ** -0.5)
logits = C * (x @ R_prime.T)
s_prime = logits.softmax(dim=-1)
w_prime, _ = torch.topk(s_prime, dim=-1)

注意这里没有给每个 token 直接跑 expert activation 来决定路由,因此没有变成密集 MoE。它只是用 expert 参数更新 router row,路由阶段仍然是稀疏 top-k。

5. 实验设计和主要结果

5.1 模型规模和训练设置

作者测试了 1B、3B、11B 三个 MoE 模型:

配置1B3B11B
Hidden dimension102415361536
Layers81212
Attention heads81616
Activated experts888
Routed experts6464256
Sequence length204840964096
Dense params296M479M479M
Sparse params806M2.72B10.88B
Activated params397M823M823M
Total params1.10B3.20B11.36B

训练框架基于 TorchTitan,MoE 实现使用 MegaBlocks,分布式训练使用 FSDP。3B 和 11B 模型在 FineWeb-Edu 上预训练 350B tokens,并保留 1B tokens 作为验证集;随后使用 OLMo 3 相关数据做 100B tokens mid-training。

5.2 1B:跨优化器稳定提升

1B 实验比较了 AdamW、AdamH、Muon、MuonH。平均 25 个任务的准确率如下:

OptimizerVanilla MoEMoE + MPI提升
AdamW42.2643.56+1.30
AdamH42.5943.93+1.34
Muon43.0143.55+0.54
MuonH42.7843.98+1.20

这说明 MPI 的收益不是依赖某一个特定优化器。作者随后选择 MuonH 做大规模实验,理由是其 1B 收敛表现和超参迁移性更好。

5.3 3B/11B:PPL 与下游任务同时改善

PPL 结果:

模型Validation PPLMath PPLCode PPL
MoE 3B0.7641.6881.376
MoE 3B + MPI0.7541.5811.296
MoE 11B0.7281.8521.263
MoE 11B + MPI0.7231.5811.259

中期训练后,作者用 ARC-C、MMLU、TriviaQA、NaturalQs、BBH、GSM8K、MBPP 等任务评估:

模型ARC-CMMLUTriviaQANaturalQsBBHGSM8KMBPPAVG
MoE 3B55.9147.0145.7817.8729.5316.2242.2536.37
MoE 3B + MPI58.9648.8346.5220.1330.9920.9244.5438.70
MoE 11B61.5450.0055.4125.3031.1717.8945.1240.92
MoE 11B + MPI62.2450.9356.8925.3631.4527.6044.8742.76

最显著的结果是 GSM8K:11B 从 17.89 提升到 27.60。不过 MBPP 在 11B 上略降,从 45.1244.87,说明 MPI 并非对所有任务都单调提升。

5.4 Router-expert alignment 的直接证据

作者用如下指标衡量 router row 与 expert 主方向的对齐程度:

λ=R[i]Wgi2R[i]2Wgi2\lambda = \frac{\|\mathbf{R}_{[i]}^{\prime}\mathbf{W}_{g}^{i}\|_2} {\|\mathbf{R}_{[i]}^{\prime}\|_2 \cdot \|\mathbf{W}_{g}^{i}\|_2}

该值归一到 [0,1][0,1]。12 层模型中,vanilla MoE 的 λ\lambda 大多在 0.22-0.37;MPI 后提升到 0.62-0.70。这直接支持论文的核心机制:MPI 确实让 router row 更贴近 expert 权重矩阵的主特异方向。

Layer123456789101112
MoE0.370.310.310.280.280.250.240.230.240.240.220.26
MoE + MPI0.670.660.690.700.680.670.640.630.620.620.620.69

5.5 负载均衡与效率

MPI 还带来负载均衡改善。3B 模型的 MaxVio 指标如下:

指标MoEMoE + MPI
MaxVio Batch1.1331.024
MaxVio Global0.9640.711

作者认为这可能来自 retraction:router row 范数被统一后,某些 expert 不会仅因 row norm 较大就被过度选择。

效率方面,11B 预训练中:

  • vanilla MoE 吞吐为 34.97B tokens/day
  • MPI 下降约 0.2%
  • 额外计算量不超过 NN 个额外 tokens 的量级;
  • 不引入通信开销;
  • 推理时 R\mathbf{R}^{\prime} 可在模型加载阶段预计算,因此没有推理时动态开销。

6. 消融实验与关键细节

6.1 只做 normalization 不够

作者比较了一个只做 row-wise normalization 的变体:

R[i]np=CR[i]R[i]2\mathbf{R}_{[i]}^{np} = C \cdot \frac{\mathbf{R}_{[i]}}{\|\mathbf{R}_{[i]}\|_2}

结果显示,它接近 vanilla MoE,明显弱于完整 MPI。这说明收益主要来自 power iteration 带来的 expert-aware alignment,而不是简单归一化。

6.2 不做 retraction 会不稳定

如果只做 power iteration 而不做 retraction,AdamW 和 Muon 设置下会出现 loss spikes 与异常梯度。即便 Hyperball 类优化器能缓解部分问题,作者也观察到预训练 loss 上升约 0.003。因此 retraction 不是装饰项,而是训练稳定性的必要组件。

6.3 单次 power iteration 比多次更好

作者尝试把 iteration count 增加到 10,以获得更精确的主方向估计。结果:

  • 吞吐下降约 5%
  • 没有带来更好的收敛或下游性能;
  • 预训练 loss 反而增加 0.002-0.003
  • 下游平均下降 1.39 个百分点。

这说明在持续训练中,“每步轻微、稳定地对齐”优于“每步强行精确对齐”。过度对齐可能扰乱 router 自身优化动态。

6.4 超参 CC^{\prime} 相对不敏感

作者在 256 experts 小规模 MoE 上搜索 C{1,2,4,8}C^{\prime} \in \{1,2,4,8\},每个模型训练 50B tokens:

CC^{\prime}1248Vanilla MoE
Val PPL0.88960.85470.85330.85630.8884

多数 MPI 设置优于 vanilla MoE,最优为 C=4C^{\prime}=4。作者随后把小规模搜索得到的设置迁移到 11B,未观察到性能崩溃。

7. 论文局限性和未来工作方向

7.1 规模上限仍是 11B,不足以证明 trillion-scale

论文最大实验是 11.36B 总参数、823M activated params。作者在注释掉的 limitation 中提到,单次 11B 训练超过 10,000 GPU hours,受计算成本限制未能进一步扩展。对于 MoE 路由设计,真正关键的问题是能否在数百 B 到 T 级总参数上保持同样收益,这仍需后续验证。

7.2 只验证了预训练和 mid-training,不覆盖 post-training 全链路

论文主要衡量 pretraining loss、PPL、下游多选/QA/math/code benchmark。它没有系统评估 instruction tuning、RLHF/RLVR、tool-use agent 或 long-context 场景下 MPI 对 MoE 的影响。由于 router 行为可能在 post-training 后发生变化,这部分仍是空白。

7.3 对 expert 矩阵组合的探索有限

作者默认使用 Wg\mathbf{W}_g 做 power iteration,虽然比较了 Wg,Wp,Wo\mathbf{W}_g, \mathbf{W}_p, \mathbf{W}_o,但没有深入研究多矩阵组合、层间差异、不同 expert 结构下的最优选择。对于不同 MoE 实现,例如 shared experts、fine-grained experts、multi-head routing,这个选择可能需要重新审视。

7.4 对负载均衡改善的机制解释仍偏初步

MPI 的 retraction 改善了 MaxVio,但作者也承认其负载均衡收益可能是 retraction 的副作用,尚未给出完整机制分析。未来可以分离研究 row norm、logit scale、expert capacity、auxiliary loss 之间的因果关系。

7.5 理论分析依赖线性矩阵视角,未完全覆盖非线性 expert 行为

主特异方向能刻画权重矩阵的最大线性响应方向,但实际 expert 包含 SiLU、乘法门控、残差路径和训练动态。router row 对齐 Wg\mathbf{W}_g 的主方向是否总能代表 expert 的功能边界,在更复杂激活分布下仍需要更细粒度的实证和理论解释。

8. 实际应用场景和潜在影响

8.1 更经济的大规模 MoE 预训练

MPI 最直接的应用是新一代 sparse MoE LLM 预训练。它的吸引力在于开销极低:训练吞吐只降约 0.2%,推理无额外开销,却能带来 PPL 和下游任务改善。如果在更大规模复现,这类设计会成为 MoE baseline 的低成本增强项。

8.2 Router 设计从经验调参转向参数几何

过去 router 改进往往围绕 loss、bias、top-k、capacity factor 和 load balancing。MPI 提醒研究者:router row 本身也可以被结构化地解释为 expert 参数的几何摘要。这可能推动更多“expert-aware router parameterization”研究,例如用多个 principal directions、低秩子空间、层级 expert descriptors 或 task-conditioned expert descriptors 来设计路由。

8.3 对推理系统友好

许多 MoE 改进方案在推理时会引入额外模型、额外相似度计算或更复杂调度。MPI 的推理权重可在加载时预计算,路由仍然是常规矩阵乘与 top-k,这对现有 inference engine、expert parallelism、kernel fusion 和 serving 调度都更友好。

8.4 对多模态 MoE 和专用专家系统有迁移潜力

如果 expert 参数确实能通过主方向形成有意义的代理向量,那么 MPI 不限于文本 LLM。多模态 MoE、代码 MoE、视觉 MoE、检索增强 MoE、agentic policy MoE 都可能受益。尤其在 expert specialization 更强的系统中,显式绑定 router 与 expert 参数可能更重要。

9. 相关工作和领域背景

9.1 Sparse MoE 与 router 问题

MoE 的核心价值是“总参数多、激活参数少”。DeepSeek、OLMoE、GLM 等路线都显示,MoE 可以在受限计算预算下提升模型容量。但 router 是整个结构的瓶颈:如果路由不准,专家再强也可能被错误 token 激活;如果负载不平衡,训练吞吐和模型质量都会受影响。

9.2 负载均衡与辅助损失

Switch Transformer、ST-MoE 等工作常用 load balancing loss、router z-loss 等手段稳定训练。MPI 与这些方法并不冲突。论文中加入 router z-loss 系数 0.001 的小规模实验没有出现异常,并带来 0.68 点下游提升,说明 MPI 可作为基础 router parameterization,再叠加常规 router regularization。

9.3 Muon、Hyperball 与范数约束优化

论文实验大量涉及 Muon、AdamH、MuonH。Muon 通过 Newton-Schulz iteration 对 momentum 做正交化;Hyperball Optimization 则强调对权重和更新施加范数约束,提升稳定性与超参迁移性。MPI 的 retraction 与这一趋势一致:在大规模预训练中,权重范数和更新几何越来越重要。

9.4 Power iteration 与主特异方向

Power iteration 是经典数值线性代数方法,用重复矩阵-向量乘法估计 dominant singular/eigen direction。MPI 的工程价值在于只做一次 iteration,但跨训练 step 持续累计效果,从而用很小代价近似追踪 expert 权重的主方向。

10. 我的判断

这篇论文的亮点是提出了一个清晰、低成本、可解释的 router 设计原则。它没有把 MoE router 当成黑盒可训练矩阵,而是把每一行都绑定到对应 expert 的参数几何上。这个想法简单,但触及了 MoE 的根本问题:router 到底在代表什么?

我认为最值得关注的是两个点。

第一,MPI 的收益不是只体现在 alignment 指标上,而是传导到了 PPL、下游任务和负载均衡。尤其在 11B 上仍保持正收益,说明它不是小规模噪声。

第二,它的工程代价非常低。很多架构改进最大的问题不是效果,而是推理系统不愿接。MPI 的推理预计算特性让它更可能被实际训练系统尝试。

但也要谨慎:论文还没有证明在更大规模、更多数据、post-training 后以及真实产品推理负载下的收益。主特异方向是否始终是 expert 的最佳代理,也不是定论。更稳妥的结论是:MPI 为 MoE router 提供了一个强而简单的几何 baseline,值得在更大 MoE 训练中复现。

参考资料