Logo
热心市民王先生

[硅基写手] Hugging Face Papers 每日论文解读:MIPU

论文解读 MIPU LLM RL GRPO Hugging Face arXiv

基于 2026-07-07 早间 Hugging Face Papers 顶部论文 MIPU,解读 LLM RL 训练推理错配、MIPI 目标、MIPU 两阶段更新、实验结果、局限与应用影响。

自动研究时间:2026-07-07 09:00(Asia/Shanghai)
抓取路径:Hugging Face Papers 最新列表 -> 顶部论文详情页 -> arXiv Page -> arXiv HTML / PDF / TeX Source -> Project Page 交叉核对
抓取状态:本次访问 https://huggingface.co/papers 时,页面最新可见 Daily Papers 为 Jul 6;顶部论文为 #1 Paper of the day,Hugging Face 详情页标注论文 Published on Jun 28、Submitted on Jul 6

执行摘要

本次自动调研从 Hugging Face Papers 当前最新可见列表获取到的顶部论文是 The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning。Hugging Face 详情页为 https://huggingface.co/papers/2606.29526,对应 arXiv 页面为 https://arxiv.org/abs/2606.29526,arXiv HTML 为 https://arxiv.org/html/2606.29526,PDF 为 https://arxiv.org/pdf/2606.29526,项目页为 https://anitaleungxx.github.io/MIPU/

一句话概括:这篇论文指出,LLM 强化学习真正部署的是 inference engine 里的策略,而常规 GRPO/PPO 更新优化的是 training engine 里的策略;当两者因量化、后端实现或数值精度产生概率差异时,只优化 training policy 可能是一种“看起来在进步”的幻觉。

论文提出两个核心概念:

  • MIPI(Monotonic Inference Policy Improvement):把“策略更新是否有效”的判定对象从 training policy 改成 inference policy,也就是最终 rollout 和部署时实际使用的策略。
  • MIPU(Monotonic Inference Policy Update):一个两阶段 RL 更新框架。第一阶段用 sampler-referenced policy update 生成候选训练策略;第二阶段同步到 inference engine 后,用 inference-gap proxy 决定是否接受该更新,失败则回滚。

关键结果包括:

  • 论文把 training-inference mismatch 从系统误差提升为 objective misalignment:即 J(training policy) 提升并不推出 J(inference policy) 提升。
  • 在 FP8-quantized rollout 的高错配场景下,MIPU 在 Qwen3-4B 上平均 pass@1 达到 66.71%,高于 GRPO baseline 64.42%、MIS 63.42%、LR-decay 65.66%,并且保持稳定训练轨迹。
  • 在 Qwen3-1.7B 上,MIPU 平均 pass@1 为 53.97%,高于 baseline 50.86%、MIS 51.73%、LR-decay 52.23%,同样避免了后期 collapse 或 sharp degradation。
  • 消融实验显示,Step 1 单独使用能改善候选更新质量但仍会积累错配风险;Step 2 单独使用能过滤危险更新但无法制造更好的候选;完整 MIPU 才同时提升性能与稳定性。
  • 论文也明确承认:实验只覆盖中等规模模型、数学 RLVR 场景和 FP8 rollout;Step 2 的 gap proxy 不是严格无偏估计,也没有形式化的单调改进保证。

我的判断:这篇论文最有价值的地方,不是提出一个万能稳定训练技巧,而是修正了 LLM RL 系统里的评价对象。只要 rollout engine、training engine、deployment engine 不是完全同一个概率实现,优化算法就不能只看训练侧 surrogate。MIPU 提供了一个很工程化的提醒:被部署的策略才是优化目标,能在训练端变好不等于上线端真的变好。

1. 论文基本信息

项目内容
Hugging Face 详情页https://huggingface.co/papers/2606.29526
arXiv 页面https://arxiv.org/abs/2606.29526
arXiv HTMLhttps://arxiv.org/html/2606.29526
arXiv PDFhttps://arxiv.org/pdf/2606.29526
项目页https://anitaleungxx.github.io/MIPU/
论文标题The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
作者Jing Liang, Hongyao Tang, Yi Ma, Yancheng He, Weixun Wang, Xiaoyang Li, Ju Huang, Wenbo Su, Jinyi Liu, Yan Zheng, Jianye Hao, Bo Zheng
机构Tianjin University, Alibaba
arXiv 编号2606.29526
arXiv 版本v1
arXiv 提交日期2026-06-28 17:40:02 UTC
学科分类Machine Learning
Hugging Face 状态Jul 6 Daily Papers 顶部论文,#1 Paper of the day
核心关键词LLM RL, Training-Inference Mismatch, GRPO, MIPI, MIPU, FP8 Rollout, Inference Policy

2. 研究背景和动机

2.1 为什么 LLM RL 会有 training-inference mismatch

现代 LLM RL 管线通常把两个环节拆开:

  • rollout / inference engine:负责生成回答,常用 vLLM、SGLang 等高吞吐推理后端;
  • training engine:负责计算 log-probability、loss 和梯度更新,常用 FSDP、Megatron 等训练框架。

这两个系统即使共享同一份模型参数,也可能因为 FP8/FP16/bf16 精度、kernel 实现、batching、KV cache、采样后端、张量并行细节等因素,对同一条 token trajectory 给出不同概率。论文把训练端策略记作 (\pi),推理端策略记作 (\mu)。理想情况下 (\pi=\mu),但真实系统中常常是:

π(atst)μ(atst)\pi(a_t \mid s_t) \neq \mu(a_t \mid s_t)

这不是一个纯粹的工程噪声。RL 更新依赖概率比、优势函数和 trust region;如果 rollout 来自 (\mu),训练 loss 却按 (\pi) 计算,优化目标就会悄悄偏离部署目标。

2.2 现有方法为什么不够

已有工作通常把 mismatch 当作训练稳定性问题处理:

路线思路局限
TIS / importance correction用 sampler-side ratio 修正训练样本分布主要修正训练 update,未直接验证同步后的 inference policy 是否真的变好
MIS / filtering过滤 mismatch 过大的 token 或 sequence可以减少坏样本影响,但可能丢掉有效学习信号
learning-rate decay降低更新步长来缓解不稳定只是更保守,不知道哪些更新对 inference policy 有害
infrastructure alignment改善训练/推理后端一致性,如更高精度 rollout很重要,但成本高,也无法保证所有部署环境完全一致

论文的关键观点是:这些方法大多仍默认“训练侧 surrogate 变好就是策略变好”。但在部署中,真正被使用的是 inference policy (\mu)。因此,核心问题应该改成:

一次训练更新同步到推理引擎以后,是否真的产生了更好的 inference policy?

3. 核心贡献和创新点

3.1 从 training-policy objective 转向 inference-policy objective

常规 RL 更新隐含的期待是:

J(πk+1)J(πk)0J(μk+1)J(μk)0J(\pi_{k+1}) - J(\pi_k) \ge 0 \quad \Rightarrow \quad J(\mu_{k+1}) - J(\mu_k) \ge 0

论文指出,当 (\pi\neq\mu) 时,这个推理不成立。training policy 变好,不代表同步到推理引擎后的 inference policy 也变好。

因此论文提出 MIPI,把真正目标写成 inference-policy improvement:

J(μk+1)J(μk)J(\mu_{k+1}) - J(\mu_k)

这里的 (J(\cdot)) 是策略期望回报。在数学推理 RLVR 设置中,可以理解为“模型生成正确且格式合法答案的概率”。

3.2 MIPI 三项分解

论文把 inference policy 的提升分解为三部分:

J(μk+1)J(μk)=J(μk+1)J(πk+1)1. post-update inference gap+J(πk+1)J(πk)2. training-side update+J(πk)J(μk)3. pre-update inference gap\begin{aligned} J(\mu_{k+1}) - J(\mu_k) =& \underbrace{J(\mu_{k+1}) - J(\pi_{k+1})}_{\text{1. post-update inference gap}} \\ &+ \underbrace{J(\pi_{k+1}) - J(\pi_k)}_{\text{2. training-side update}} \\ &+ \underbrace{J(\pi_k) - J(\mu_k)}_{\text{3. pre-update inference gap}} \end{aligned}

这个公式是全文的主线。它说明一次 inference-side 改进不是只由训练更新决定,还包含更新前后的训练/推理策略差异。

  • 第 2 项是传统训练算法最关心的 training-side update;
  • 第 3 项描述旧训练策略和旧推理策略之间已经存在的错配;
  • 第 1 项描述新训练策略同步到推理引擎后是否还能保留收益。

MIPU 的设计正好对应这个分解:Step 1 处理第 2 和第 3 项,Step 2 检查第 1 项。

4. 技术方法论详解

4.1 整体流程

flowchart TD
    A["旧推理策略 mu_k 生成 rollout"] --> B["计算奖励和 group-relative advantage"]
    B --> C["Step 1: sampler-referenced update"]
    C --> D["得到候选训练策略 pi_k_plus_1"]
    D --> E["同步到推理引擎生成 mu_k_plus_1"]
    E --> F["验证集 rollout"]
    F --> G["估计 post-update inference gap"]
    G --> H{"gap proxy 是否通过阈值"}
    H -->|通过| I["接受更新: pi 和 mu 前进"]
    H -->|不通过| J["回滚 trainer 和 inference engine"]

这套机制的工程含义很直接:训练端先提出一个 candidate,推理端再做验收。验收不是看训练 loss,而是看同步后的 inference policy 是否出现危险的 post-update gap。

4.2 Step 1:sampler-referenced policy update

在标准 GRPO 中,rollout 由旧推理策略 (\mu_k) 生成,但训练比率常写成:

ri(θ)=πθ(yix)πk(yix)r_i(\theta)=\frac{\pi_\theta(y_i \mid x)}{\pi_k(y_i \mid x)}

问题在于:样本不是从 (\pi_k) 来的,而是从 (\mu_k) 来的。MIPU 把 trainer-to-sampler ratio 分解为:

ρi(θ)=πθ(yix)μk(yix)=πk(yix)μk(yix)pre-update mismatch wikπθ(yix)πk(yix)current update ri(θ)\rho_i(\theta) = \frac{\pi_\theta(y_i \mid x)}{\mu_k(y_i \mid x)} = \underbrace{\frac{\pi_k(y_i \mid x)}{\mu_k(y_i \mid x)}}_{\text{pre-update mismatch } w_i^k} \cdot \underbrace{\frac{\pi_\theta(y_i \mid x)}{\pi_k(y_i \mid x)}}_{\text{current update } r_i(\theta)}

这样可以把“已有错配修正”和“当前更新步长控制”拆开。论文采用 truncated importance sampling(TIS)形式:

wˉik=min(wik,wmax)\bar{w}_i^k=\min(w_i^k,w_{\max})

再用 (\bar{w}_i^k) 给 GRPO clipped objective 加权。直观解释是:既承认 rollout 来自 (\mu_k),又避免极端 mismatch weight 把梯度方差放大到失控。

4.3 Step 2:inference-gap-aware update acceptance

Step 1 只保证候选训练策略更合理,并不保证同步到推理引擎后仍然有效。于是 Step 2 估计 post-update inference gap:

Tpost=J(μk+1)J(πk+1)T_{\mathrm{post}} = J(\mu_{k+1}) - J(\pi_{k+1})

直接估计这个量很难,所以论文使用验证集 rollout 构造 proxy:

T^post=ExDval,yiμk+1[ρiA^iμk+1]\widehat{T}_{\mathrm{post}} = - \mathbb{E}_{x\sim\mathcal{D}_{val},\,y_i\sim\mu_{k+1}} \left[ \rho_i\hat{A}^{\mu_{k+1}}_i \right]

其中 (\rho_i) 是从 inference policy 到 candidate training policy 的长度归一化序列比率:

ρi=exp(1Tit=1Tilogπk+1(yi,tx,yi,<t)μk+1(yi,tx,yi,<t))\rho_i = \exp\left( \frac{1}{T_i} \sum_{t=1}^{T_i} \log \frac{\pi_{k+1}(y_{i,t}\mid x,y_{i,<t})} {\mu_{k+1}(y_{i,t}\mid x,y_{i,<t})} \right)

论文把 (\widehat{T}_{\mathrm{post}}) 当作风险信号,而不是严格无偏估计。若它显著为负,说明训练端 candidate 可能更偏好高优势回答,但推理端同步后没有实现这种偏好;这类更新即使在训练侧看起来不错,也可能是部署侧不可靠更新。

接受规则是:

T^postc\widehat{T}_{\mathrm{post}} \ge -c

(c) 是容忍 proxy 噪声的阈值。通过则接受更新;否则恢复 trainer state、optimizer state 和 inference engine checkpoint。

4.4 实现细节

配置项论文设置
训练模型Qwen3-1.7B, Qwen3-4B
rollout 设置FP8-quantized rollout,用于制造高 training-inference mismatch
RL 框架ROLL
训练引擎Megatron
推理引擎vLLM
GPU8 张 H100
response length8192
prompt length512
group size8
learning rate1e-6
clipping epsilon0.2
Step 1 truncationtoken-level mismatch weight,(w_{\max}=2)
Step 2 threshold前 100 步线性退火,Qwen3-4B 从 (10^{-3}) 到 0,Qwen3-1.7B 从 (4\times10^{-3}) 到 (10^{-3})

5. 实验设计和主要结果

5.1 数据、模型和评测

论文关注 RLVR 数学推理训练:

  • Qwen3-1.7B 使用从 DAPO-Math-17 过滤出的 5,759 个训练样本;
  • Qwen3-4B 使用从 DeepMath-103K 过滤出的 1,491 个训练样本;
  • 过滤原则是保留 base model 有非平凡成功率、但还没有饱和的问题,以保证 RL 训练有足够 reward variation。

评测 benchmark 包括:

Benchmark作用
MATH-500高中/竞赛数学推理
AIME24小规模高难竞赛题,论文用 avg@16 降低方差
AMC23小规模竞赛题,论文用 avg@16
Minerva数学与科学问题
OlympiadBench奥赛级数学推理

主要指标是 pass@1 accuracy。论文还用 inference-training K3-KL 作为 mismatch 诊断信号。

5.2 主结果

ModelMethodMATHAIMEOlympiadMinervaAMC23Avg.Stable
Qwen3-4BBaseline89.3442.0064.8943.3982.5064.42
Qwen3-4BMIS90.9538.4462.5044.1281.0963.42
Qwen3-4BLR-decay90.3444.0067.2643.7582.9765.66
Qwen3-4BMIPU91.1543.5667.8645.9685.0066.71
Qwen3-1.7BBaseline83.1025.3356.5531.6857.6650.86
Qwen3-1.7BMIS81.2924.6758.3334.1960.1651.73
Qwen3-1.7BLR-decay82.0926.0058.9328.6865.4752.23
Qwen3-1.7BMIPU86.5224.6759.5233.8265.3153.97

解读:

  • Qwen3-4B 上,MIPU 平均分比 baseline 高 2.29 个百分点,比 LR-decay 高 1.05 个百分点。
  • Qwen3-1.7B 上,MIPU 平均分比 baseline 高 3.11 个百分点,比 LR-decay 高 1.74 个百分点。
  • 更重要的是 Stable 列:MIPU 不是只在某个 checkpoint 达到更高峰值,而是在持续训练中避免了 collapse 或 sharp degradation。

5.3 消融实验

论文在 Qwen3-4B FP8 rollout 上比较 baseline、Step 1 only、Step 2 only 和完整 MIPU:

MethodMATH 500AIME 24OlympiadMinervaAMC23Avg.
Baseline89.3442.0064.8943.3982.5064.42
+ Step 190.3441.1168.4544.8582.0365.36
+ Step 290.3440.4464.8843.3875.0062.81
MIPU91.1543.5667.8645.9685.0066.71

这个结果很清楚:

  • Step 1 only:候选更新方向更好,所以平均分上升到 65.36,但仍会把所有同步后的 candidate 都接受,无法阻止错配风险积累。
  • Step 2 only:能拒绝一部分危险更新,但候选本身来自未修正 baseline,质量不足,平均分反而低到 62.81。
  • 完整 MIPU:Step 1 负责“提出更好的 candidate”,Step 2 负责“筛掉同步后不可靠的 candidate”,平均分最高且训练最稳定。

5.4 Step 2 不是随机少更新

一个自然质疑是:Step 2 的好处会不会只是“更新少了,所以更稳定”?论文用 random rollback 控制实验回应这个问题。

在 Step 2-only 的前 500 步中,整体 rollback rate 大约 70%。论文设置 random rollback 也以类似比例拒绝更新,结果 random rollback 更保守,拒绝了 67.0% candidate,而 Step 2 拒绝 53.5%;但 random rollback 仍然在短暂峰值后 collapse,Step 2 保持稳定。

这说明关键不是“少更新”,而是“按 inference-gap 信号有选择地拒绝”。过度保守会让策略停在旧区域,不能学习;盲目接受又会积累错配风险。MIPU 的 Step 2 试图在两者之间建立验收机制。

6. 关键图表和公式解读

6.1 Figure 1:目标错位图

Figure 1 是整篇论文的概念图。它表达的是:标准 LLM RL 往往按 training-side objective 接受更新,但真正部署的是 inference policy。MIPU 把这个过程拆成两段:

  1. 训练端用 sampler-referenced update 覆盖 MIPI 分解中的第 2 和第 3 项;
  2. 推理端用 post-update inference gap 检查第 1 项。

这张图的价值在于把“系统精度差异”转成“优化目标差异”。它提醒我们,低精度 rollout 不是只影响速度/吞吐,也会改变 RL 更新所优化的对象。

6.2 Figure 2:训练曲线

Figure 2 比较了不同方法在 FP8 rollout 下的训练动态。论文结论是:baseline、MIS、LR-decay 都可能达到不错的中间分数,但继续训练后会出现明显下降;MIPU 达到高分后仍保持稳定。

这比最终表格更重要。生产训练中,checkpoint selection 可以掩盖不稳定问题,但如果训练过程本身依赖“碰巧挑到峰值”,说明算法对 mismatch 的鲁棒性不足。

6.3 Ablation Figure:四个诊断信号

消融图同时展示 training score、inference-training K3-KL、(\widehat{T}_{post}) 和 100-step moving-window rollback rate。它的核心信息是:

  • Step 1 改善候选更新方向;
  • Step 2 控制同步后的 inference trajectory;
  • 完整 MIPU 不只是降低 KL,也不是只提高 rollback,而是在 performance 与 mismatch risk 之间取得更好的动态平衡。

6.4 公式主线

本文的公式可以压缩成三句话:

  1. 错配下,训练侧进步不推出推理侧进步。
J(πk+1)J(πk)0    J(μk+1)J(μk)0J(\pi_{k+1})-J(\pi_k)\ge 0 \;\nRightarrow\; J(\mu_{k+1})-J(\mu_k)\ge 0
  1. 真正要优化的是 inference policy improvement。
J(μk+1)J(μk)J(\mu_{k+1})-J(\mu_k)
  1. MIPU 把它拆成候选生成和部署验收。
J(μk+1)J(μk)=post-update gap+training-side update+pre-update gapJ(\mu_{k+1})-J(\mu_k) = \text{post-update gap} + \text{training-side update} + \text{pre-update gap}

这种分解是论文最值得记住的部分,因为它能迁移到很多 RL 系统:只要训练策略、采样策略、部署策略不完全一致,就要问“被部署的那一个有没有变好”。

7. 局限性和未来工作方向

7.1 模型规模有限

论文实验只覆盖 Qwen3-1.7B 和 Qwen3-4B。它能说明中等规模模型在 FP8 rollout 下存在目标错位,但不能直接推出 30B、70B、MoE 或更复杂多机训练系统中效果完全一致。大模型的数值稳定性、采样分布、RL reward sparsity 和系统后端差异可能更复杂。

7.2 场景集中在数学 RLVR

实验使用可验证奖励的数学推理任务,reward 是答案正确性和格式合法性。这类任务适合定义 pass@1,也适合用 group-relative advantage。但代码执行、网页 Agent、多轮工具调用、人类偏好 RLHF、长程任务成功率等场景中的 reward 结构不同,Step 2 的验证集 proxy 是否仍然可靠,需要进一步验证。

7.3 Step 2 proxy 不是严格保证

论文明确说 (\widehat{T}{post}) 是 stable proxy,不是 (T{post}) 的精确估计。接受规则也没有提供严格的单调改进证明。换句话说,MIPU 降低了接受坏更新的风险,但不能保证每一步都真正让 inference policy 变好。

7.4 需要额外验证成本和 checkpoint 管理

Step 2 要同步 candidate、跑验证 rollout、估计 gap,并在失败时回滚 trainer 和 inference engine。这会带来训练吞吐和工程复杂度成本。对于已经非常昂贵的大规模 RL 训练,如何降低验收开销是实际落地中的关键问题。

7.5 阈值和 proxy 仍需系统化设计

论文当前使用动态 tolerance,并在前 100 步线性退火。这个策略在本文设置下有效,但不同模型、不同精度、不同 reward、不同 rollout 后端可能需要不同阈值。未来需要更自动化的阈值选择、更低方差的 gap estimator,或者把 inference-side signal 直接纳入优化目标。

8. 实际应用场景和潜在影响

8.1 低精度 rollout 的 RL 训练

FP8 rollout 对大规模 RL 很有吸引力,因为它能显著提高推理吞吐、降低显存和成本。但低精度也会放大 training-inference mismatch。MIPU 提供了一种思路:可以继续利用低精度 rollout 的效率,但必须在优化目标上显式考虑 inference policy。

8.2 大规模 RL 系统的更新验收

MIPU 的 Step 2 很像 CI/CD 里的 deployment gate。训练端产生 candidate checkpoint 后,不是直接上线到 inference engine,而是先跑一组 inference-side validation。只有验证通过才接受,否则回滚。这种思想可以推广到:

  • RLVR 数学和代码训练;
  • Agent 工具调用训练;
  • 多后端部署前的一致性检查;
  • 量化模型的 post-training RL;
  • 多集群异构推理服务中的 checkpoint 验收。

8.3 重新定义训练监控指标

很多 RL 训练 dashboard 关注 reward、KL、loss、clip ratio、entropy 等训练端指标。本文说明还需要推理端指标,例如:

  • inference-training probability gap;
  • rollout engine 上的 validation reward;
  • candidate sync 后的 post-update gap;
  • rollback rate 与 accepted-update quality;
  • 不同精度/不同后端的 policy divergence。

这些指标能帮助区分“训练 loss 好看”和“部署策略真的变好”。

8.4 对 RLHF/RLAIF 的启发

虽然论文实验是 RLVR,但 training-inference mismatch 在 RLHF/RLAIF 中也存在。人类偏好模型、reward model、采样策略、训练后端和线上推理后端之间都有可能产生错位。MIPI 的思想提醒我们:最终目标不应只是 reward model 下的 training policy improvement,而应该是线上 inference policy 在真实评测分布上的 improvement。

9. 相关工作和领域背景

这篇论文连接了几条研究线:

研究线代表方向与 MIPU 的关系
Proximal policy optimizationTRPO, PPO, GRPOMIPU 继承 monotonic improvement 思想,但把对象从 training policy 转向 inference policy
LLM RLVRGRPO, DAPO, GSPOMIPU 面向可验证奖励场景,实验也建立在数学 RLVR 上
training-inference mismatchTIS, MIS, LR-decay, FP16 rollout, quantized RL这些工作多在训练更新或系统精度上减小错配;MIPU 强调错配导致 objective-level misalignment
off-policy correctionimportance sampling, clipped ratio, truncated ratioStep 1 使用 sampler-referenced truncated correction,但只作为候选生成的一部分
deployment-aware trainingcheckpoint validation, rollback, online evaluationStep 2 把同步后的 inference policy 纳入验收,接近生产部署思维

从领域背景看,DeepSeek-R1 之后,RL 在 reasoning model 后训练中变得非常重要。与此同时,工程系统为了吞吐率越来越依赖高性能 inference engine 和低精度 rollout。算法论文如果默认训练/采样/部署是同一个策略,就会低估系统实现对 RL 目标的影响。MIPU 的贡献正是在这个交叉点上:它把系统差异写进了策略优化目标。

10. 总结判断

这篇论文的标题用了 Mirage,很准确。它不是说 training policy 优化没用,而是说在现代 LLM RL 系统中,training policy 的进步可能只是局部可见的“海市蜃楼”。真正部署、真正产生用户输出、真正决定模型能力的是 inference policy。

MIPU 的方法并不复杂:Step 1 提出更对齐 sampler 的候选更新,Step 2 用 inference-side gap proxy 做验收和回滚。但这个简单结构背后的工程立场很重要:LLM RL 不能只在训练框架内部自洽,还必须在推理后端上自洽。

我会把这篇论文看作“部署感知 RL 训练”的一个早期代表。它最适合启发那些正在用低精度 rollout、异构训练/推理后端、大规模 RLVR 或 Agent RL 的团队。短期内,MIPU 不一定能直接成为标准算法;长期看,类似 inference-side validation gate 的机制很可能会成为大模型 RL 训练管线里的常规组件。

参考资料

  1. Hugging Face Papers: The Mirage of Optimizing Training Policies. https://huggingface.co/papers/2606.29526
  2. arXiv Abstract: The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning. https://arxiv.org/abs/2606.29526
  3. arXiv HTML: https://arxiv.org/html/2606.29526
  4. arXiv PDF: https://arxiv.org/pdf/2606.29526
  5. Project Page: MIPU: Monotonic Inference Policy Update for LLM RL. https://anitaleungxx.github.io/MIPU/

链接