Logo
热心市民王先生

[硅基写手] Hugging Face Papers 每日论文解读:Direct-OPD

论文解读 RLVR Weak-to-Strong Hugging Face arXiv

基于 2026-07-15 早间 Hugging Face Papers 最新可见顶部论文 Weak-to-Strong Generalization via Direct On-Policy Distillation,解读 Direct-OPD、弱到强泛化、策略位移、隐式奖励、实验结果、局限与应用影响。

自动研究时间:2026-07-15 09:00(Asia/Shanghai)
抓取路径:Hugging Face Papers 最新列表 -> 顶部论文详情页 -> arXiv Page -> arXiv HTML / PDF / TeX Source -> 项目页交叉核对
抓取状态:本次访问 https://huggingface.co/papers 时,最新可见 Daily Papers 日期为 Jul 14,顶部论文为 Weak-to-Strong Generalization via Direct On-Policy Distillation。Hugging Face 详情页显示该论文 Published on Jul 8、Submitted on Jul 14,并标注为 #1 Paper of the day。因此,本报告按 2026-07-15 自动任务生成,记录的是当前 Hugging Face 最新可见顶部论文。

执行摘要

本次自动调研抓取到的顶部论文是 Weak-to-Strong Generalization via Direct On-Policy Distillation。Hugging Face 论文页为 https://huggingface.co/papers/2607.05394,arXiv 页面为 https://arxiv.org/abs/2607.05394,PDF 为 https://arxiv.org/pdf/2607.05394,HTML 版本为 https://arxiv.org/html/2607.05394,项目页为 https://bytedtsinghua-sia.github.io/Direct-OPD/

一句话概括:Direct-OPD 不复制小模型 RL 后的最终策略,而是提取“小模型 RL 前后策略差”作为隐式 dense reward,再把这个改进方向用到强学生模型自己的 on-policy 轨迹上。

这篇论文解决的是 RLVR 后训练的扩展成本问题。对每个更强模型重新跑 RLVR,需要让目标模型自己生成大量 rollout、拿稀疏可验证奖励、再更新策略;模型越大,这条路径越贵。作者提出一种弱到强替代路线:先在小模型上便宜地跑 RL,让小模型学到一个“RL 改变了什么”的方向;然后把这个方向迁移给更强学生模型。核心实验显示,Direct-OPD 将 Qwen3-1.7B 在 AIME 2024 上从 48.3% 提升到 58.3%,只需约 4 小时、8 张 A100;在多个 teacher pair 和 student family 上都出现收益,并且多个 policy shift 可以顺序组合。

需要谨慎看待的是,论文主要在数学推理任务 AIME 2024/2025 上验证,训练数据也围绕数学推理;它还依赖能访问小模型 RL 前后 checkpoint 的白盒或半白盒条件。因此,Direct-OPD 是一个很有启发性的 post-training 范式,但还不能直接推出它在通用对话、多模态、代码 Agent 或偏好对齐任务中同样稳定。

1. 论文基本信息

项目内容
论文标题Weak-to-Strong Generalization via Direct On-Policy Distillation
方法简称Direct-OPD
作者Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou
机构SIA-Lab of Tsinghua AIR and ByteDance Seed; Institute for AI Industry Research, Tsinghua University; Department of Computer Science and Technology, Tsinghua University; Peking University
arXiv 编号2607.05394
arXiv 版本v1: 2026-07-06; v2: 2026-07-08
Hugging Face 状态Jul 14 Daily Papers 顶部论文,#1 Paper of the day
学科分类Machine Learning; Artificial Intelligence; Computation and Language
论文定位弱到强泛化 / on-policy distillation / RLVR 后训练复用
项目页https://bytedtsinghua-sia.github.io/Direct-OPD/

2. 研究背景和动机

2.1 RLVR 很有效,但强模型上重复运行很贵

RLVR(reinforcement learning with verifiable rewards)已经成为提升推理模型的重要后训练路线。它的典型流程是:模型生成多个解题轨迹,外部 verifier 判断答案是否正确,训练算法根据稀疏结果奖励更新模型。DeepSeek-R1、Qwen、OpenReasoner、DAPO、JustRL、Polaris 等工作都说明这条路线能显著改善数学和推理能力。

问题在于,RLVR 的成本绑定在被训练模型上。目标模型越大,每次 rollout 越慢,采样越贵,RL 迭代越难扩展。若每次发布新强模型都要从头跑一遍 RLVR,后训练本身会变成瓶颈。

2.2 直接蒸馏弱教师为什么不够

一个自然想法是:先让小模型跑 RL,得到 post-RL teacher,再把它蒸馏给大模型。但论文指出,这个对象选错了。

小模型 RL 后的最终策略同时包含两类信息:

成分含义迁移到强学生的风险
RL 学到的改进方向哪些推理动作、token、解题模式被奖励推高这是有价值信号
小模型自身能力上限小模型原本的表达习惯、错误模式、容量限制可能把强学生拉回弱教师水平

论文给出的代表性现象是:R1-Distill-7B 初始 AIME 2024 分数已经是 56.7,高于 post-RL JustRL-1.5B 的 51.3;如果用 vanilla OPD 去模仿这个小教师的最终策略,强学生反而被拖低到约 50。也就是说,弱教师的最终分布不是合适的迁移目标。

2.3 Direct-OPD 的关键判断

作者的核心判断是:真正应该迁移的不是 post-RL teacher 本身,而是 teacher 从 pre-RL 到 post-RL 的策略位移。

如果一个 1.5B 模型经过 RL 后更倾向于某些 token、推理步骤或答案格式,这个“概率如何被 RL 改变”的方向,可能比它最后的绝对输出分布更有价值。Direct-OPD 正是把这个方向抽出来,作为强学生模型的 dense supervision。

3. 核心贡献和创新点

3.1 贡献一:把小模型 RL 结果解释为可迁移的隐式奖励

Direct-OPD 定义 teacher pair:

  • (\pi_{T_{\mathrm{ref}}}):小模型 RL 前的 reference checkpoint;
  • (\pi_T):小模型 RL 后的 teacher checkpoint;
  • (\pi_S):强学生初始 checkpoint;
  • (\pi_\theta):正在训练的强学生。

它从 teacher pair 中读取策略位移:

ΔT(yx)=logπT(yx)logπTref(yx)\Delta_T(y \mid x) = \log \pi_T(y \mid x) - \log \pi_{T_{\mathrm{ref}}}(y \mid x)

这个 log-ratio 为正,表示 RL 让小模型更偏好该响应;为负,表示 RL 抑制该响应。它丢掉小模型原本就喜欢什么,只保留 RL 改变了什么。

3.2 贡献二:用 policy-as-reward 恒等式建立理论解释

论文使用 KL-regularized RL 的闭式最优解解释该位移为什么像 reward。对 reward (r)、reference policy (\pi_{\mathrm{ref}})、KL penalty (\beta > 0),目标:

maxπEyπ[r(x,y)βlogπ(yx)πref(yx)]\max_\pi \mathbb{E}_{y \sim \pi} \left[ r(x,y) - \beta \log \frac{\pi(y \mid x)}{\pi_{\mathrm{ref}}(y \mid x)} \right]

对应最优策略满足:

π(yx)πref(yx)exp(r(x,y)/β)\pi^*(y \mid x) \propto \pi_{\mathrm{ref}}(y \mid x)\exp(r(x,y)/\beta)

因此:

logπ(yx)πref(yx)=1βr(x,y)logZ(x)\log\frac{\pi^*(y \mid x)}{\pi_{\mathrm{ref}}(y \mid x)} = \frac{1}{\beta}r(x,y) - \log Z(x)

对同一个 prompt,(\log Z(x)) 是常数,所以 policy/reference log-ratio 可以恢复 reward 的方向和相对强度。Direct-OPD 反过来用这个关系:既然已有 post-RL teacher 和 pre-RL reference,就从二者差值里读出 teacher 的隐式 reward。

3.3 贡献三:在强学生自己的 on-policy 状态上迁移

Direct-OPD 不要求学生生成和教师相同的轨迹。学生先自己 rollout,形成 prefix (s_t=(x,y_{<t})),然后在学生实际访问的状态上查询 teacher pair 的 token-level shift:

rt(v)=logπT(vst)logπTref(vst)r_t(v) = \log \pi_T(v \mid s_t) - \log \pi_{T_{\mathrm{ref}}}(v \mid s_t)

这使监督信号落在学生真实会走到的状态空间里,而不是让强学生被迫复刻弱教师的完整输出。

flowchart TD
    A["小模型 pre-RL reference"] --> C["计算策略位移"]
    B["小模型 post-RL teacher"] --> C
    C --> D["log-ratio 隐式奖励 Delta_T"]
    E["强学生模型"] --> F["生成自己的 on-policy rollout"]
    F --> G["在学生 prefix 上读取 token-level shift"]
    D --> G
    G --> H["top-k dense supervision"]
    H --> I["KL 锚定到学生初始模型"]
    I --> J["Direct-OPD 更新强学生"]

3.4 贡献四:验证弱到强、低成本和可组合性

论文不是只做单个 teacher-student 演示,而是验证三件事:

  1. 小 RL teacher 的策略位移能改善已经强于 teacher 的 student;
  2. 同等 RL step 下,先在小模型跑 RL 再迁移,比直接在大模型跑 RL 更划算;
  3. 不同 RL 过程得到的 policy shift 可以顺序叠加到同一个 student。

4. 技术方法论详解

4.1 Direct-OPD 的序列级目标

Direct-OPD 对学生优化的理想化目标为:

JDirect-OPD(θ)=ExD[Eyπθ(x)[ΔT(yx)]αDKL(πθ(x)πS(x))]J_{\mathrm{Direct\text{-}OPD}}(\theta) = \mathbb{E}_{x \sim \mathcal{D}} \left[ \mathbb{E}_{y \sim \pi_\theta(\cdot \mid x)} \left[\Delta_T(y \mid x)\right] - \alpha D_{\mathrm{KL}} \left( \pi_\theta(\cdot \mid x) \Vert \pi_S(\cdot \mid x) \right) \right]

其中 (\alpha) 控制学生偏离初始模型 (\pi_S) 的程度。这个目标的最优策略形式为:

π(yx)πS(yx)(πT(yx)πTref(yx))1/α\pi^*(y \mid x) \propto \pi_S(y \mid x) \left( \frac{\pi_T(y \mid x)} {\pi_{T_{\mathrm{ref}}}(y \mid x)} \right)^{1/\alpha}

直观解释:强学生不是向 (\pi_T) 靠拢,而是在自己的初始策略 (\pi_S) 上,按 teacher pair 给出的改进方向做指数倾斜。

4.2 从序列奖励到 token-level dense reward

语言模型策略可以按 token 分解,因此序列级策略位移也可分解:

ΔT(yx)=trt(ytst)\Delta_T(y \mid x) = \sum_t r_t(y_t \mid s_t)

Direct-OPD 使用 zero-discount token-level surrogate,把每个候选 token 的即时 shift 当作 dense reward。这样比只在最终答案上给 reward 更细粒度,也比直接模仿 teacher distribution 更不容易继承 teacher 的容量上限。

4.3 top-k 限制与 Rao-Blackwellized 梯度

实际实现不会在全词表上查询和计算,而是在学生当前 prefix 下的 top-k 候选 token 集合 (S_t) 上工作。论文默认 student top-k support 为 16。学生概率在 (S_t) 上归一化为 (\bar p_t(v)),再结合 teacher shift (r_t(v)) 构造局部梯度。

核心思想是:既然已经知道 top-k 内每个候选 token 的 reward,就不必只用采样到的那个 token 估计梯度;可以对 top-k 候选求期望,降低 token 采样方差。论文把这称为 analytical top-k policy gradient / Rao-Blackwellized per-step estimator。

4.4 自适应 KL 控制

Direct-OPD 面临一个尺度问题:teacher 的 log-ratio 大小由小模型 RL 时的 reward 和 KL budget 决定,但迁移时无法直接知道这个尺度是否适合 student。因此固定 (\alpha) 不一定稳定。

论文提出轻量 adaptive KL controller:根据当前 batch 上 dense reward 的符号和均值调节 KL 系数。当学生访问的区域上 teacher shift 平均为正时,提高 KL 约束,避免过度放大局部信号;当平均为负时,降低约束,让模型更容易离开被 teacher RL 抑制的 token 区域。论文分析显示,最优固定 KL 与 teacher-student pair 有关,自适应 KL 能减少手动扫参压力。

5. 实验设计和主要结果

5.1 实验设置

论文围绕三个研究问题设计实验:

问题实验设计
RQ1小 teacher 的 RL-induced policy shift 能否改善已经匹配或强于 teacher 的学生?
RQ2同等 RL step 下,小模型先 RL 再 Direct-OPD 迁移,是否优于直接在大模型上 RL?
RQ3多个独立 RL 过程得到的 policy shift 是否能顺序组合?

主要 teacher pair 包括:

  • R1-Distill-1.5B -> JustRL-1.5B;
  • Nemotron-1.5B -> QuestA-Nemotron-1.5B;
  • Qwen3-1.7B-nonthinking RL shift -> Qwen3-4B-nonthinking。

评估基准为 AIME 2024 和 AIME 2025,默认每题 32 samples,采样 temperature 0.7,top-p 0.95,最大生成长度 31,744。训练框架为 verl,Direct-OPD 默认 300 steps、global batch size 64、rollout 数 4、最大 response length 2,048。

5.2 结果一:弱 teacher 的 RL 方向能改善强 student

R1-Distill-1.5B -> JustRL-1.5B 的迁移结果如下:

模型AIME24AIME25
Teacher ref28.524.0
Teacher RL51.337.5
Qwen3-1.7B48.336.8
Qwen3-1.7B + Direct-OPD58.3 (+10.0)43.2 (+6.4)
Qwen3-4B72.565.6
Qwen3-4B + Direct-OPD77.6 (+5.1)68.8 (+3.2)
R1-Distill-7B56.740.5
R1-Distill-7B + Direct-OPD63.1 (+6.4)48.8 (+8.3)

这里最关键的是 Qwen3-4B 和 R1-Distill-7B 初始就强于 JustRL-1.5B teacher,但 Direct-OPD 仍然带来提升。这说明迁移的是 RL 改进方向,而不是小 teacher 的绝对能力。

QuestA teacher pair 也出现类似趋势:

模型AIME24AIME25
Teacher ref61.849.5
Teacher RL72.562.3
Qwen3-1.7B48.336.8
Qwen3-1.7B + Direct-OPD59.0 (+10.7)43.1 (+6.3)
R1-Distill-7B56.339.5
R1-Distill-7B + Direct-OPD61.2 (+4.9)44.0 (+4.5)

5.3 结果二:小模型 RL + 迁移比大模型直接 RL 更划算

论文比较两条路线:

flowchart LR
    A["路线 A: R1-Distill-7B 直接 RL"] --> B["高 rollout 成本"]
    B --> C["目标模型自己发现改进方向"]
    D["路线 B: R1-Distill-1.5B 先 RL"] --> E["低成本发现 policy shift"]
    E --> F["Direct-OPD 迁移到 R1-Distill-7B"]
    F --> G["约 4 小时 8xA100 迁移成本"]

实验中,R1-Distill-1.5B 进行 1500-step RL 大约需要 160 小时、32 张 A100;R1-Distill-7B 直接 RL 大约需要 320 小时。小模型 RL 后,Direct-OPD 迁移阶段只需约 4 小时、8 张 A100。论文报告,在匹配 RL step 的比较下,先让小模型学方向、再迁移到大模型,能在更短 wall-clock 路径下取得更好结果。

Qwen3 nonthinking 设置中也观察到类似现象:Qwen3-1.7B-nonthinking 跑 100-step RL 后,把 policy shift 迁移给 Qwen3-4B-nonthinking,AIME 2025 达到 0.635,接近直接 Qwen3-4B RL 的水平。

5.4 结果三:policy shift 可以顺序组合

论文还把两个不同 teacher pair 的策略位移依次应用到 Qwen3-1.7B:

阶段AIME24AIME25
Initial48.336.8
After JustRL shift58.3 (+10.0)43.2 (+6.4)
After QuestA shift63.8 (+15.5)46.8 (+10.0)

这说明不同 RL 过程学到的“方向”可能具有一定可叠加性。它类似 task arithmetic 的行为版:不是叠加权重差,而是在学生自身轨迹上叠加多个 teacher/reference log-ratio 信号。

6. 关键图表与公式解读

6.1 Figure 1:为什么不是模仿 teacher

Figure 1 的重点是对比 vanilla OPD 与 Direct-OPD。vanilla OPD 让强学生追随 post-RL teacher 的最终分布;如果 teacher 更弱,学生会被教师能力上限拖累。Direct-OPD 只读取 (\pi_T - \pi_{T_{\mathrm{ref}}}) 的方向,因此可以在学生原有能力上做增量改进。

6.2 Figure 2:跨模型族、跨 teacher pair 迁移

Figure 2 展示 R1-Distill、Qwen3、JustRL、QuestA 等不同组合下的 AIME 曲线。该图支持两个判断:第一,Direct-OPD 的收益不是某一个 teacher 或 student 的偶然现象;第二,它不要求 teacher endpoint 一定强于 student endpoint。

6.3 Figure 3:弱到强路线的成本收益

Figure 3 把直接大模型 RL 与小模型 RL + Direct-OPD 的 wall-clock 路径放在一起。解读重点不是“Direct-OPD 完全替代 RL”,而是“小模型可以成为便宜的 RL 探索器”。大模型不必重新探索所有 credit assignment,只需要吸收小模型已经编码在 checkpoint pair 里的 reward-like direction。

6.4 核心公式:policy shift 是隐式 reward

整篇论文最重要的公式链条是:

ΔT(yx)=logπT(yx)logπTref(yx)1βrT(x,y)logZT(x)\Delta_T(y \mid x) = \log \pi_T(y \mid x) - \log \pi_{T_{\mathrm{ref}}}(y \mid x) \approx \frac{1}{\beta}r_T(x,y) - \log Z_T(x)

它把“小模型 RL 后概率变大/变小”解释为“该响应在小模型 RL reward 下更/不值得做”。Direct-OPD 的所有工程细节,包括 top-k、dense token reward、adaptive KL,都是围绕如何稳定地把这个信号读给强学生。

7. 局限性和未来工作

7.1 任务范围仍然集中

论文主要验证数学推理,尤其 AIME 2024/2025。数学任务有可验证答案,适合 RLVR 和 policy-shift 分析,但这不等价于开放式写作、对话安全、工具调用、多模态理解或长程 Agent 工作流。未来需要在代码、科学推理、多轮规划、检索增强、偏好对齐等任务上验证。

7.2 需要 teacher pair checkpoint

Direct-OPD 的前提是能访问同一个 teacher 的 pre-RL 和 post-RL checkpoint,并能在学生 visited prefix 上查询二者的 token distribution。这对开源或内部训练体系可行,但对只提供 API 的闭源模型很难。

7.3 信号并非总是可靠

作者明确指出,Direct-OPD 可能在 teacher 的 RL shift 没有携带有用方向时失败;最佳 response length 与 KL strength 也依赖 teacher-student pair。如果学生 rollout 偏离到 teacher pair 不可靠的区域,log-ratio 可能不再代表有意义的 reward。

7.4 成本对比还不是完整工业账本

论文给出 GPU hour 级别的训练路径对比,但真实生产还要考虑 teacher scoring、checkpoint 存储、工程并行、数据清洗、失败重跑、推理部署收益等。Direct-OPD 降低的是强模型重复 RL 探索成本,不等于后训练总成本可以忽略。

8. 实际应用场景和潜在影响

8.1 更便宜地升级强模型推理能力

如果一个团队已经能在小模型上快速运行 RLVR,那么 Direct-OPD 提供了一条把小模型探索结果迁移到大模型的路径。这对模型迭代很有价值:每次 reward、数据或 verifier 更新后,可以先让小模型探索,再把方向迁移给多个强学生。

8.2 用小模型做“策略实验沙盒”

小模型可以成为 RL 实验的低成本沙盒。研究者可以快速试不同 reward、prompt、数据和 RL recipe,再把有价值的 policy shift 转移到强模型。这样把“探索”与“承载最终能力”解耦。

8.3 多个能力方向的组合

顺序组合实验暗示,不同 teacher pair 可能编码不同能力方向。未来可以想象:

  • 数学推理 shift;
  • 代码修复 shift;
  • 工具调用 shift;
  • 安全拒答 shift;
  • 长答案规划 shift。

如果这些 shift 能稳定组合,后训练可能从“训练一个最终模型”转向“管理一组可复用的行为方向”。

8.4 对弱到强对齐研究的启发

传统 weak-to-strong 往往关注弱监督标签是否能诱发强模型能力。Direct-OPD 给出另一个角度:弱监督不一定是标签或最终策略,也可以是弱模型被优化过程写入的 policy-space delta。这个观点对 scalable oversight、reward reuse、model editing 和 post-training pipeline 都有启发。

9. 相关工作和领域背景

论文的相关工作可归为四条线:

方向与 Direct-OPD 的关系
RLVR reasoning modelsDirect-OPD 复用小模型 RLVR 的结果,避免每个强模型重复稀疏奖励探索
On-policy distillationDirect-OPD 沿用学生自采样轨迹上的监督接口,但不模仿 teacher 最终策略
Weak-to-strong generalization目标是让弱监督提升强模型,但监督对象从弱标签/弱分布变成 policy shift
DPO / implicit reward同样利用 policy/reference log-ratio 与 reward 的关系,只是 Direct-OPD 反向读取已训练模型中的 reward-like signal

对整个领域而言,这篇论文的价值在于把“RL 后 checkpoint”重新解释为一种可读取的 reward artifact。它不只是一个模型文件,也不是一个被动 teacher,而是包含了 RL 过程写入的方向信息。

10. 总结判断

Direct-OPD 的核心贡献可以概括为三句话:

  1. 小模型 RL 后的最终策略不一定值得模仿,但小模型 RL 前后的策略差值得迁移。
  2. 这个策略差可以通过 KL-regularized RL 的 policy-as-reward 恒等式解释为隐式 dense reward。
  3. 把该 reward 放到强学生自己的 on-policy 状态上,比让强学生复制弱教师更符合 weak-to-strong 的目标。

如果后续工作能证明 Direct-OPD 在代码、工具调用、多模态、偏好对齐和长程任务中也稳定有效,它可能成为降低 RLVR 后训练成本的重要方法。当前最稳妥的评价是:这是一篇把“弱模型 RL 结果如何服务强模型”讲清楚的高质量方法论文,但其适用边界仍需要跨任务、跨 reward 类型和跨模型访问条件继续验证。

参考资料