本页目录 RIDE

RIDE

RIDE 将强化学习教师相对基础模型的逐层隐藏状态残差视为可继续前进的方向,在学生自身轨迹上越过教师构造回归目标,以更低采样噪声实现稳定的同初始化在策略蒸馏。四组数学推理模型实验显示其均值达到或略超教师,并揭示输出头衰减与采样方差为何让概率空间外推失稳。

论文基本信息

  • 题目:The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation
  • 作者:Hao Li、MeiJia Chen、Weijie Ren、Donghan Li、Zijun Tian、Jingchun Huang、Naibo Wang
  • 机构:中国科学技术大学、Rutgers University、浙江大学及独立研究者
  • arXiv:2609.36484v1,2026 年 9 月 29 日提交,类别 cs.LG,共 19 页
  • Daily Papers:2026 年 10 月 1 日榜首
  • 链接:Hugging Face 详情页;arXiv 摘要页;arXiv PDF 全文;项目仓库

一句话结论

RIDE 的核心洞见是:经 RL 训练的教师不只是学生要抵达的终点,教师相对其训练前基础模型的逐层表示变化还提供了一个可外推方向;直接在隐藏状态空间沿此方向构造目标,比在输出概率空间放大采样得到的 log-ratio 更完整、更稳定,但代价是必须同时保留同架构的基础模型与教师,并额外执行一次冻结模型前向传播。

背景与动机

在策略蒸馏(On-Policy Distillation,OPD)中,学生先生成自己的回答轨迹,教师再对学生实际访问到的前缀提供逐 token 监督。相较于只用教师离线样本,这种做法缓解了 exposure bias,并给每个生成位置提供密集信号。标准 OPD 的目标却是让学生匹配教师,因此教师天然成为能力上限。

已有广义 OPD 方法把教师与参考模型的对数概率比解释为隐式奖励,再放大该奖励,使学生有机会超过教师。论文指出,这条“输出空间外推”路线有两个结构性问题:

  1. 语言模型头的奇异值谱高度各向异性。RL 在隐藏状态中产生的变化大量集中于模型头的弱方向,投影到 logits 后只剩较弱信号,而且输出损失无法直接约束更早的网络层。
  2. 输出空间外推依赖从学生分布抽出的单个 token 来估计 log-ratio。外推系数越大,采样噪声会按系数的平方项放大;当教师与基础模型本来就很接近时,噪声甚至可能淹没真正的 RL 信号。

作者由此提出一个更直接的问题:既然教师是从基础模型经过 RL 得到的,为什么不在共享的表示空间中测量“RL 究竟把模型推向了哪里”,再让学生沿这个方向继续走?

核心贡献

  1. 定义 RL-induced representation residual:在完全相同的学生生成前缀上,以教师和其 pre-RL 基础模型在每一层、每一位置的隐藏状态差,隔离 RL 对计算过程造成的变化。
  2. 提出 RIDE(RL-Induced Direction Extrapolation):把表示匹配目标从教师状态移到教师之外,只改目标构造即可在 λ = 1 时精确退化为 OPRD,在 λ > 1 时沿 RL 残差外推。
  3. 给出两层解释:从优化角度,RIDE 等价于在线性方向奖励与教师邻域二次惩罚之间折中;从机制角度,表示空间保留被模型头削弱的信号,并消除了固定前缀下的 next-token 条件采样方差。
  4. 在四个不同规模、架构与预训练谱系的模型对上进行三种子实验。RIDE 是唯一在四组实验中平均分都达到或略超 RL 教师的方法,并通过系数扫描、模型头诊断和方向消融验证收益来源。

方法:把教师的变化当作方向

同初始化前提

论文研究的不是任意教师—学生组合,而是一个严格场景:基础模型为 π_B,教师为从它经过 RL 得到的 π_T = RL(π_B),可训练学生也从 π_B 初始化。三者拥有相同架构、tokenizer 和表示坐标系,因而可以逐层直接相减。

对提示 x,学生 π_θ 先采样轨迹 ŷ。随后冻结的基础模型和教师都读取完全相同的前缀 (x, ŷ_<t)。第 l 层、第 t 个位置的 RL 残差为:

Δ_t^(l) = h_T,t^(l) - h_B,t^(l)

相同前缀至关重要:如果基础模型和教师各自生成轨迹,两者隐藏状态的差会同时混入“看到了不同 token”和“RL 改变了计算”两种因素。

外推目标与训练损失

RIDE 将学生要回归的隐藏状态目标设为:

h*_t^(l) = h_T,t^(l) + (λ - 1)Δ_t^(l)
          = λh_T,t^(l) + (1 - λ)h_B,t^(l)
  • λ = 0:目标是基础模型;
  • 0 < λ < 1:目标位于基础模型与教师之间;
  • λ = 1:目标就是教师,精确恢复 OPRD;
  • λ > 1:目标越过教师,继续沿 RL 诱导的方向移动。

学生在所有层、回答最后 2,000 个位置上,用按隐藏维度归一化的平方误差回归该目标。论文默认 λ = 1.25,并将损失系数乘以 λ^-2,抵消初始化时目标距离随 λ² 增长导致的有效步长变化。

为什么隐藏状态空间更合适

如果模型头 W_head 固定且线性,把 RIDE 目标投影到 logits,正好得到 λz_T + (1-λ)z_B。这说明输出空间外推可以看成表示空间外推经过模型头后的投影,但反方向并不成立:输出目标无法恢复模型头弱奇异方向中的完整残差,也不能约束更早的层。

论文在 R1-Distill-1.5B 实验中发现,模型头最弱的 512 个方向承载了 79.8% 的 RL 残差隐藏状态能量,而各向同性基线仅为 33.3%;这些方向在 centered-logit 空间只保留 30.0% 的残差能量。对应地,弱方向获得表示损失梯度的 73.0%,却只获得输出 KL 在模型头输入处梯度的 48.6%。这并非模型头完全丢弃信号,而是把关键方向最多衰减约 40 倍。

稳定性来自哪里

输出空间 ExOPD 的 sampled-token advantage 包含外推项,其条件方差中有 (λ-1)² Var[ρ];即使学生已接近教师,只要 RL 改变过该位置的 next-token 分布,这一项仍不会消失。RIDE 的目标由固定前缀和两个冻结模型确定,因此在同一前缀上重采样下一个 token 时,逐位置梯度不变,条件方差为零。

从优化角度看,朝 h* 做平方误差回归,等价于最大化沿残差 Δ 的线性奖励,同时以到教师状态的平方距离作为惩罚。λ-1 控制继续前进的力度,因此 RIDE 不是无约束地远离教师,而是在明确方向与局部约束之间求平衡。

实验设计

模型、数据与基线

四组 base/RL-teacher 分别为:

  • DeepSeek-R1-Distill-Qwen-1.5B → JustRL-DeepSeek-1.5B
  • Qwen3-4B → Just-Qwen3-4B
  • Llama-3.2-3B → Just-Llama-3.2-3B
  • Phi-4-mini → Just-Phi-4-mini

训练提示来自 DAPO-Math-17K。每种方法训练 500 步,每步 8 个提示、每个提示采样 2 个回答,最大回答长度 16,384 tokens;优化使用 AdamW、峰值学习率 1×10^-5、bf16 与 FSDP,硬件为 4 张 H200。评价覆盖 AIME 2024、AIME 2025 和 AIMO(AMC 2022–2023),每题采样 16 次后计算 Avg@16,并对三个基准做不加权平均。

基线包括 sampled-token OPD top-1、OPD top-16、表示匹配 OPRD,以及使用相同基础模型和相同 λ、但在输出空间外推的 ExOPD。主表中的训练方法均报告三个独立训练种子(14、42、2027)的均值。

主要实验结果

下表摘录论文主结果的三个基准宏平均 Avg@16(%):

模型对RL 教师原始学生OPRDExOPDRIDE
R1-Distill-1.5B55.3039.0054.5049.8756.38
Qwen3-4B65.5962.8262.0148.7566.07
Llama-3.2-3B13.016.9910.946.9513.33
Phi-4-mini17.9615.1317.3312.2218.30

RIDE 相对 OPRD 提高 0.97–4.06 个百分点,相对 ExOPD 平均提高约 9.1 个百分点。它在四组模型对上分别比教师高 1.08、0.48、0.32 和 0.34 个百分点,是唯一每组均值都越过教师的方法。不过后三组领先幅度处在一个训练种子标准差之内,因此更稳妥的表述是“达到或略超教师”,而非已经证明了显著超越。

输出空间外推的失败尤其值得注意:ExOPD 在四组上都低于教师;当教师相对基础模型只提升 2.8–6.0 分时,它甚至低于未训练学生,Qwen3-4B 一组低了 14.1 分。这支持了论文关于“信号较小时,外推噪声占主导”的解释。

系数扫描、机制分析与消融

λ 并非越大越好

在 R1-Distill-1.5B 的单种子扫描中,RIDE 从 λ = 1 的 54.3 上升到 λ = 1.25 的峰值 55.4;λ = 1.15–1.35 均优于教师匹配。到 λ = 1.5 和 2 时,分数回落至 52.3 和 52.4,但退化相对平缓。

ExOPD 则在所有 λ > 1 的设置中受损:λ = 2 时 Avg@16 降至 46.2,格式正确率从 λ = 0.5 时的 92.1% 降至 64.4%,平均回答长度增至 8,704 tokens。实测其条件方差从 λ = 1 到 2 增长 12.6 倍,与理论中的平方项一致;RIDE 在固定前缀上的 next-token 条件方差保持为零。

真正有效的是 RL 残差方向

论文固定外推位移的模长,只替换方向进行控制实验。OPRD 得分为 54.50,随机方向、反向、错误来源模型、不同轨迹残差分别得到 55.04、53.90、54.75、55.12,而正确 RL 残差达到 56.38。各控制组都没有复现 RIDE 的完整增益,说明收益并非单纯来自放大损失或任意正则效应。

工程成本与实现含义

RIDE 可以在 OPRD 管线之上实现:教师 worker 额外加载冻结的 pre-RL 基础模型,在学生轨迹上多做一次前向传播,就地合成 h*,再向 trainer 发送一份隐藏状态张量。通信量与 OPRD 相同,但冻结模型前向次数从一次增加到两次,且需要同时容纳基础模型和教师。

这种方案适合已经保留 RL 前后 checkpoint、且模型架构一致的训练团队。它对“把一次昂贵 RL 结果蒸馏回基础模型”或“合并共享同一基础模型的 RL 专家”尤其有吸引力。相反,如果只有 API 教师、拿不到中间状态,或教师与学生宽度、层数、tokenizer 不同,公式不能直接套用,需要先设计表示映射或改用输出级蒸馏。

局限与审慎解读

  • 适用范围严格:方法要求 pre-RL checkpoint、教师与学生共享表示空间。异构模型蒸馏、不同初始化或只提供 logits 的闭源教师不在当前验证范围内。
  • 任务覆盖单一:所有训练与评价都集中在竞赛数学,且四个教师使用同一种 JustRL 配方;尚不能确认残差外推能否迁移到代码、事实问答、工具使用或开放式生成。
  • 超越教师的证据有限:四组均值虽都略高于教师,但三组差距小于一次训练标准差;Llama 一组的 AIME 分数又接近评价地板,主要证据来自 AIMO。
  • 全局系数过于粗糙:论文只使用一个全局 λ。不同层、位置、样本和训练阶段的最佳外推强度可能不同,较大的 λ 仍会带来性能回落。
  • 代价高于普通蒸馏:每条 rollout 要运行学生、教师和基础模型,并传输所有受监督层的隐藏状态。论文报告的是每条 rollout 的操作量,而非完整 wall-clock、显存峰值或成本收益曲线。
  • 复现尚不完整:论文给出了超参数和实现细节,但截至抓取时,项目仓库只有概览,训练代码、评测脚本与 checkpoint 尚未发布。
  • 安全与校准未知:沿教师残差继续外推可能放大教师经 RL 引入的偏差或错误;合成目标不是任何真实模型曾产生的状态,学生的置信校准与安全行为不能假定等同于教师。

应用影响

RIDE 把“蒸馏上限”从教师输出本身改写为教师训练轨迹中蕴含的方向信息。对模型训练平台而言,这意味着 pre-RL checkpoint 不应只被视为备份,它还可以成为解释和复用 RL 更新的参照系。若结果在更多任务上成立,团队可用一次 RL 训练产生教师,再通过表示级外推把能力稳定回灌到同初始化学生,甚至用于多个同源专家的组合。

论文也对训练系统设计提出了实际启示:需要保留版本谱系、支持冻结模型并行前向、暴露逐层 residual stream,并把同一 on-policy 前缀准确送入多个 checkpoint。换言之,方法本身的公式很短,但其价值依赖模型血缘和训练基础设施是否完整可追踪。

更广泛地看,RIDE 表明后训练变化并不只存在于最终 token 分布中。隐藏层可能保存了被输出头压缩的结构化学习信号,未来可以用于层自适应外推、跨任务方向组合、RL 更新诊断,以及判断一次后训练究竟改变了哪些计算路径。

相关工作

RIDE 位于三条研究线的交点。第一条是 OPD:学生在自己的轨迹上接受教师监督,以降低离线模仿的分布偏移;标准 sampled-token OPD 和 top-k 变体都主要约束输出分布。第二条是“超越教师”的广义 OPD 与模型外推,它们把教师—参考模型 log-ratio 当作隐式奖励,或在参数、logit 空间放大微调位移,但容易受长度偏置、奖励过优化和采样方差影响。第三条是表示级知识蒸馏,从 FitNets 一类中间特征匹配延伸到 OPRD 的 on-policy 逐层回归;RIDE 与 OPRD 的训练框架相同,区别只在于目标是否越过教师。

它还与 activation steering 和 model editing 中的“行为方向”观点相呼应:某些能力或行为变化可以由隐藏空间中的向量方向表达。RIDE 的特殊之处在于该方向不是离线求得的固定向量,而是在学生访问到的每个上下文、每一层和每个位置上,由 RL 前后两个 checkpoint 动态计算。

总结

RIDE 用一个简洁的目标替换,把同初始化蒸馏从“复制教师”变为“识别并延续 RL 的表示变化”。论文最有说服力的部分不只是四组均值达到或略超教师,而是理论方差分析、模型头奇异方向诊断、λ 扫描和方向控制实验共同解释了为什么表示空间外推优于输出空间外推。

当前结论仍应限定在同架构、同初始化、竞赛数学和单一 RL 配方内。若代码发布并在异构模型与更多任务上复现,RIDE 可能成为连接 RL 后训练、表示分析与知识蒸馏的一条实用路径;在此之前,它更像一个证据扎实、边界清晰的研究原型,而非可以无条件替换现有 OPD 的通用方案。

参考资料

  1. Hugging Face Daily Papers:RIDE
  2. arXiv:The Teacher Is a Direction, Not a Destination
  3. arXiv PDF 全文
  4. RIDE 项目仓库