本页目录 OPSA

OPSA

基于 Hugging Face Daily Papers 2026-09-01 榜首论文,深入解析 OPSA 如何以低概率 token 与位置熵构造无教师的负优势信号,重新解释 On-Policy Distillation 的增益来源,并审视其数学推理收益、分布重塑机制、算力代价与外推边界。

自动研究时间:2026-09-02 09:02(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Sep 1,列表最顶部为 Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> 20 页 arXiv PDF 与 HTML 全文(含实验、相关工作、限制和附录)-> 官方项目页与代码仓库。

执行摘要

On-Policy Distillation(OPD)的标准叙事很有吸引力:学生模型先生成轨迹,能力更强的教师再对每个 token 给出密集优势信号,学生由此学习教师偏好的行为。但这篇论文指出一个容易被忽略的错位:教师评分时面对的是学生采样出的前缀,这些状态对教师本身是 off-policy 的。教师越强、与学生分布相距越远,逐 token 打分未必越可靠。

作者先用可验证的最终答案 token 检查这种错位。以 Qwen3-1.7B 为学生时,4B、30B-A3B 和 235B-A22B 教师的总体噪声率分别为 30.6%、34.7% 和 50.6%;这里的“噪声”指正确答案 token 得到负优势,或错误答案 token 得到正优势。更反常的是,只用含噪轨迹、只用干净轨迹和使用全部轨迹训练,最终都达到近似表现。结果并不证明教师的所有中间反馈都无效,却足以动摇“学生主要靠模仿教师而进步”的单一解释。

进一步的梯度与消融分析给出另一套机制解释。51.7% 的 token 优势绝对值小于 10410^{-4},这些近零优势又集中在学生本来就很确信的高 log-probability token 上;只训练这些 token 几乎没有收益。反过来,把训练限制在学生采样轨迹中 logp 最低的 20% token,即使将教师优势全部替换为固定的 0.5-0.5,仍能复现接近 OPD 的提升。固定正优势则导致响应长度快速缩短、梯度爆炸和策略坍塌。换言之,OPD 的关键作用可能不是传入了多精细的教师排序,而是持续压低学生偶然采到的低概率 token。

由此,论文提出 On-Policy Self-Adaptation(OPSA):每条响应只更新最低 logp 的 20% token,为它们分配 [1.0,0.5][-1.0,-0.5] 范围内的负优势,且位置熵越高,负信号越强。优势完全从学生自身的 token 概率与熵计算,不需要教师、奖励模型、可验证答案或 reference hint。作者认为这种更新会压低 tail token,同时把概率质量重新分配给多个 head token:低熵位置变得更可靠,高熵“推理分叉”仍保留多条候选路径。

主实验支持了这一方法的效果。在非 thinking 模式下,Qwen3-1.7B 的 AIME24 Avg@32 从 13.44 提升到 48.85,增加 35.41 个百分点;AIME25 和 HMMT25 也分别增加 25.62 与 17.60 个百分点,三项 Pass@32 均超过基础模型的两倍。OPSA 在三项数学基准上的平均 Avg@32 为 35.83,高于对比方法中的最佳结果 11.04 个百分点;Qwen3-4B 与 Qwen3.5-9B 同样受益,并在 MBPP+、GPQA-Diamond 上获得较小但一致的提升。

这项工作的价值在于把 OPD 从“知识迁移技术”重新拆成“teacher information”与“policy reshaping”两个可能机制,并给出一个无需外部监督的可执行替代方案。不过,“零外部监督”只描述训练信号:训练仍使用经过筛选的 DAPO-17k 问题,模型能力来自既有预训练和后训练。实验最大只到 9B,主收益集中在数学域,模型均来自 Qwen 家族;OPSA 还把 Qwen3-1.7B 的平均响应从 4,457 token 拉长到 23,205 token。它降低了训练阶段的教师成本,却可能把一部分成本转移到推理阶段。

1. 论文基本信息

项目内容
论文标题Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
方法名称On-Policy Self-Adaptation(OPSA)
论文编号arXiv:2608.31046
当前版本v1,2026-08-31 提交;PDF 共 20 页、12 幅图
Hugging Face 状态2026-09-01 Daily Papers 列表最顶部,详情页标记为当日第 1 名
作者Yi Ding、Ruqi Zhang
机构Purdue University,Department of Computer Science
主分类Machine Learning(cs.LG);同时归入 Computation and Language(cs.CL)
核心问题OPD 的收益究竟来自教师知识,还是来自对学生自身概率分布的重塑
训练信号学生采样 token 的 logp 与位置熵;无教师、无标签、无可验证奖励、无 hint
训练数据DAPO-17k,仅使用问题;官方复现实例列出 17,398 条训练记录
评测范围AIME24、AIME25、HMMT25、MBPP+、GPQA-Diamond
开放状态论文 CC BY 4.0;官方代码 Apache-2.0,公开训练脚本、配置与 checkpoint

核心链接:

2. 背景与动机:教师正在评价不属于自己的轨迹

2.1 为什么需要比结果奖励更密集的信号

RLVR 通常对同一道题采样多条回答,再按最终答案是否正确构造组内优势。它不依赖人工过程标注,但对长推理链只提供 response-level 的稀疏信号;当组内回答全对或全错时,归一化后的优势还可能全部消失。模型知道整条轨迹好或坏,却不知道具体哪个 token 把推理带到了正确或错误分支。

OPD 用 reverse KL 缓解这个问题。学生先按自身策略 πs\pi_s 生成响应,教师 πt\pi_t 在相同前缀上计算 token 概率,给出:

Ai=logπt(yix;y<i)πs(yix;y<i).A_i=\log\frac{\pi_t(y_i\mid x;y_{<i})}{\pi_s(y_i\mid x;y_{<i})}.

教师相对更喜欢当前 token 时 Ai>0A_i>0,相对不喜欢时 Ai<0A_i<0。这种信号密集到每一个位置,但代价是学生和教师必须共享 tokenizer,还要对白盒教师 logits 做额外前向计算。

2.2 “on-policy”只对学生成立

轨迹来自学生,因此对学生是 on-policy;教师却被迫在自己未必会抵达的学生前缀上评分。分布差距越大,教师越像是在评价另一套思维过程中突然出现的局部 token。论文的核心质疑不是“强教师没有知识”,而是教师知识能否在 off-policy 前缀上转化成方向可靠的逐 token 优势

On-Policy Self-Distillation(OPSD)把外部教师换成带参考答案等 hint 的同一策略,可以缩小模型结构差距,但仍需要额外答案、采样或标注,而且保留了“条件化教师为学生轨迹打分”的同一范式。作者因此先检查监督本身,再问能否把有效机制从教师中剥离出来。

3. 核心贡献

3.1 用可验证答案 token 定量测量 OPD 噪声

中间推理步骤没有逐 token 真值,作者只在 \boxed{} 内的最终答案 token 上定义方向冲突:

  • 正确答案收到负优势;
  • 错误答案收到正优势。

以 Qwen3-1.7B 为学生,对 DAPO-17k 的 500 道题各抽取一条正确和一条错误响应,再让三个规模的 Qwen3 Instruct 教师评分。测得结果如下:

教师总体噪声率正确轨迹被负向打分错误轨迹被正向打分
Qwen3-4B-Instruct30.6%20.4%40.8%
Qwen3-30B-A3B-Instruct34.7%43.4%26.0%
Qwen3-235B-A22B-Instruct50.6%97.8%3.4%

最大教师几乎不再区分最终答案对错,而是对正确与错误答案 token 都近乎一致地给负信号。作者将其解释为教师规模增大后,师生分布错位进一步扩大。更重要的控制实验是:标准 OPD、只保留含噪轨迹、只保留无噪轨迹,经过相近步数后表现接近。教师优势的方向正确性似乎不是学生进步的必要条件。

3.2 找出真正产生有效梯度的 token

对采样 token yty_t,logit 级更新量与下式成正比:

ΔztAt(1πs(ytx;y<t)).\Delta z_t\propto A_t\left(1-\pi_s(y_t\mid x;y_{<t})\right).

这揭示两个梯度接近零的区域:AtA_t 接近零,或学生对当前 token 的概率接近 1。实验中 29.2% 的 token 优势恰为零,51.7% 的优势绝对值小于 10410^{-4};这些 token 又主要位于学生的高 logp 区域。只在 top-logp token 上训练,不论使用原始 OPD 优势还是 [1,1][-1,1] 随机优势,AIME24 都几乎不提升。

有效学习集中在另一端:学生自身采到、但原本认为不太可能的 token。把训练限制在最低 logp 的 20%,OPD 仍接近全 token 训练;再把教师优势替换成统一的 0.5-0.5,仍出现稳定增益和与 OPD 相似的响应长度增长。这个实验切断了教师携带的细粒度偏好信息,只保留“压低低概率采样 token”这一操作。

3.3 提出完全由策略内部不确定性驱动的 OPSA

固定负优势证明教师并非必要,却没有区分两类低 logp token:

  • 高熵位置:概率分散在多个合理候选上,采样 token 虽低概率,却可能对应一条有价值的新分支;
  • 低熵位置:模型高度确信少数候选,偶然采到的极低概率 tail token 更可能把推理带偏。

OPSA 在每条响应内部选出最低 logp 的 20% token,并按这些位置的相对熵分配动态优势:

Aidyn=12HiHmin2(HmaxHmin),iSlowest 20%.A_i^{\text{dyn}} =-\frac{1}{2} -\frac{H_i-H_{\min}}{2(H_{\max}-H_{\min})}, \qquad i\in\mathcal{S}_{\text{lowest }20\%}.

因此优势范围为 [1,0.5][-1,-0.5]:相对高熵位置得到更强负信号,相对低熵位置得到较弱负信号;其余 80% token 不进入 policy loss。代码实现还需要处理所选位置熵完全相同时分母为零的退化情况,官方项目页对此有专门提示。

3.4 重新解释“负优势”如何同时提高精度与保留探索

负优势不是简单把整个分布变尖。根据采样 token 位于 head/tail、当前位置为高熵/低熵,可分成四种更新:

情形OPSA 的主要效果
高熵 + tail token压低偶然采到的弱分支,把质量移回多个 head 候选
高熵 + head token被压低的质量分给其他 head 候选,维持分叉处的多样性
低熵 + tail token抑制自信位置上的罕见错误分支
低熵 + head token通常不在最低 logp 20% 内,因而保留高置信预测

作者据此提出:OPSA 降低的是无效尾部探索,而不是抹掉关键分叉处的候选多样性。平均熵可以下降,但不确定性被更有结构地保留在真正需要选择的高熵位置。

4. 方法与实现细节

4.1 训练循环

一次 OPSA 更新可以概括为四步:

  1. 用当前策略对问题采样一条响应,同时保留每个 token 的 actor logp 与位置熵;
  2. 在单条响应内部按 logp 排序,选出最低的 20%;
  3. 在所选位置内部对熵做 min-max 归一化,生成 0.5-0.51.0-1.0 的动态负优势;
  4. 只对这些位置计算 policy-gradient loss,更新当前策略后继续下一轮 on-policy 采样。

它不是自训练伪标签,也不从多数投票推断答案;模型不需要知道当前响应是否正确。OPSA 只根据“我采到了一个自己原本不太相信的 token”以及“当时我有多不确定”来重塑下一轮分布。

4.2 训练配置

配置论文设置
框架slime 0.2.4
训练 / rollout 引擎Megatron 0.16.0rc0 / SGLang 0.5.14
硬件8 张 NVIDIA H100 或 H200;标准表列 8×H100
学习率1×1061\times10^{-6}
Rollout / global batch size64 / 64
每个 prompt 的训练采样数1
训练解码temperature 1.0,top-k -1,top-p 1.0,最长 12,000 token
评测解码temperature 0.7,top-k 20,top-p 0.8,最长 32,768 token
评测采样每题 32 条,报告 Avg@32 与 Pass@32
Checkpoint 选择每 20 步验证,以验证集 Avg@4 选择最佳 checkpoint

训练问题来自 DAPO-17k,作者强调不读取训练记录里的答案和 label。数学评测覆盖 AIME24、AIME25 与 HMMT25;跨域评测使用代码生成 MBPP+ 与一般科学问答 GPQA-Diamond。除专门的 thinking 模式实验外,训练和评测均关闭 thinking mode。

4.3 计算路径为什么比 OPD 短

OPD 除学生 rollout 与反向更新外,还需要部署教师并对整条学生轨迹做 forward pass。OPSA 的优势来自学生 rollout 已经产生的 logp 与熵,额外计算很小。Qwen3-1.7B 上,论文报告 GRPO、OPD、OPSA 的单步时间分别为 186.2 秒、61.2 秒和 46.3 秒。

但训练步更快不等于端到端使用更便宜。OPSA 诱导更长的反思式回答,Qwen3-1.7B 在 AIME24 的平均输出从基础模型 4,457 token 增至 23,205 token,平均推理时间从 1.78 秒增至 6.58 秒。部署评估必须同时计入训练节省与推理增量。

5. 实验结果

5.1 跨模型主结果

下表中数学任务写作 Avg@32 / Pass@32,MBPP+ 与 GPQA-Diamond 只报告 Avg@32:

模型AIME24AIME25HMMT25MBPP+GPQA-Diamond
Qwen3-1.7B13.44 / 40.009.69 / 30.005.73 / 23.3358.2427.92
+ OPSA48.85 / 80.0035.31 / 66.6723.33 / 50.0059.4432.40
Qwen3-4B23.33 / 56.6720.52 / 56.6713.13 / 33.3366.9338.46
+ OPSA62.08 / 83.3358.44 / 83.3337.40 / 60.0068.3541.29
Qwen3.5-9B76.35 / 93.3356.04 / 93.3344.48 / 86.6777.3370.53
+ OPSA87.81 / 96.6776.98 / 96.6767.40 / 93.3379.2773.70

结果呈现三个层次:

  • 小模型的数学单样本准确率提升最大,Qwen3-1.7B 三项 Avg@32 相对提升 263.5%–307.2%;
  • 已经较强的 Qwen3.5-9B 仍有 11.46–22.92 个 Avg@32 点的数学增益,说明效果不只存在于后训练较弱的基础模型;
  • MBPP+ 只提升 1.20–1.94 点,GPQA-Diamond 提升 2.83–4.48 点,说明跨域方向一致,但证据强度远低于训练同域数学任务。

5.2 与其他 on-policy 方法的比较

在 Qwen3-1.7B 上,作者比较 GRPO、TTRL、OPD、OPSD 与 OPSA。三项数学任务平均结果如下:

方法是否需要外部监督平均 Avg@32平均 Pass@32
基础模型不适用9.6231.11
GRPO需要可验证奖励24.7954.44
TTRL不需要,但以测试时自一致性构造信号11.8127.78
OPD需要外部教师 logits22.1554.44
OPSD需要 reference hint23.5856.67
OPSA不需要教师、reward 或 hint35.8365.56

相对每列最佳基线,OPSA 的平均 Avg@32 高 11.04 点,平均 Pass@32 高 8.89 点。开启模型原生 thinking mode 后,OPSA 仍把平均 Avg@32 从 35.24 提升到 40.71,但 Pass@32 只从 71.11 到 72.22;这与论文在限制部分的判断一致:OPSA 更擅长重新分配已有概率质量,不一定大幅扩张模型能够探索到的解空间边界。

5.3 机制消融

论文没有只给排行榜,还用四组消融检验机制:

  1. 优势符号:最低 logp 20% 上固定 0.5-0.5 可持续提升,固定 +0.2+0.2 在约 40 步内引发响应缩短和梯度爆炸;
  2. 熵相关方向:高熵位置获得更强负优势的 δ=1\delta=1 方案在 AIME24 Avg@4 达到 50.0%,高于标准 OPD 的 35.13%;反向相关方案更不稳定;
  3. 分叉 token:屏蔽 top-5 候选中含 “wait”“but” 等反思词的分叉位置后,准确率和响应长度增益大幅消失,约 300 步时长度坍塌;
  4. token 比例:最低 10% 的设置明显较差,因其几乎只包含 top-1 之外的极端 tail token,容易过度锐化;20%、30%、40% 都把 Avg@4 推到 45 以上,20% 足以获得主要收益。

作者还用 32 条回答之间的 token 4-gram Jaccard distance 衡量多样性。随着比较前缀变长,OPSA 与基础模型的距离差逐渐接近零;三项 Pass@32 也没有下降。这支持“整体熵降低但长程分支多样性保留”的解释,不过 4-gram 距离只衡量表面序列差异,不等同于语义或策略空间的多样性。

5.4 长回答是否只是换来了更多计算

OPSA 的回答显著变长,性能提升可能只是 test-time compute 增加。作者构造了 token-budget-matched 对照:删除 GRPO 或 OPD 回答末尾的 \boxed{},附加一个 “wait” 后继续生成,使平均长度接近 OPSA。AIME24 Avg@32 中,GRPO 从 33.96 降至 32.81,OPD 从 32.08 降至 31.67,而 OPSA 为 48.85。

这排除了“只要强制多写一些 token 就能得到同等收益”的简单解释,但仍不是完全等价的计算控制:OPSA 在训练中改变了每个位置的分布,而附加 “wait” 只是推理期续写。更稳妥的结论是,长度增长本身不足以解释收益,不能反过来证明全部收益都来自论文提出的分叉重分配机制。

6. 局限与批判性分析

6.1 噪声测量只覆盖最终答案 token

“教师监督噪声高”是全文最醒目的结论,但论文无法验证中间推理 token 的正确方向,只检查可自动判定的 \boxed{} 答案 token。一个教师可能在最终答案 token 上给负优势,却在前面的推理步骤提供有价值的信息。因此,这组实验足以说明 OPD 收益不依赖最终答案 token 的方向一致性,尚不足以证明教师的整条 token-level 监督都没有知识。

6.2 更大教师更噪并不等于规模导致噪声

教师规模与师生分布距离同时变化,实验只有同一 Qwen 系列的三个教师点,没有控制模型校准、训练方式和与学生的 KL 距离。“规模越大越噪”更准确地说是当前设置下的相关现象;作者提出的分布错位解释合理,但仍需在相同规模不同距离、相同距离不同规模的设计中验证。

6.3 “无外部监督”有明确口径

OPSA 不读取训练标签、答案、教师 logits、verifier reward 或 hint,这是相对 OPD/RLVR 的实质优势。但它并非从真空中学习:

  • 基础模型已经吸收了大规模预训练和后训练数据;
  • 训练 prompt 来自经过筛选的数学题集 DAPO-17k;
  • checkpoint 由验证集 Avg@4 选择,研究开发过程也观察了 AIME24 表现。

因此,更准确的称呼是“训练时无任务级外部反馈信号”,而不是完全不依赖外部数据或评价。

6.4 模型、规模与任务覆盖仍窄

三种主模型都属于 Qwen,最大为 9B。论文明确承认尚不清楚 OPSA 能否扩展到更大 dense 模型或 MoE;对于已经高度锐化、熵很低的重后训练模型,可重新分配的概率质量也可能有限。主收益来自数学推理,MBPP+ 与 GPQA-Diamond 的增益较小,尚未覆盖对话、安全、工具调用、长上下文或多模态能力。

6.5 推理成本和过度思考风险

OPSA 让模型更常产生反思词并显著延长回答。这对竞赛数学可能有益,在简单问答或延迟敏感服务中却可能形成 overthinking:更多 token、更多延迟、更高服务成本,还可能增加在正确路径上自我怀疑的机会。论文报告了平均 token 与时间,但没有给出按题目难度动态停止、短答任务质量或真实 serving 吞吐。

6.6 统计稳定性仍需加强

AIME 每年只有 30 题,虽然每题采样 32 次能估计 Avg@32 与 Pass@32,样本题目的覆盖仍有限。主表没有置信区间、跨训练 seed 方差或显著性检验;checkpoint 又按验证表现挑选。后续工作应报告多次独立训练、固定 checkpoint 选择规则和更大评测集,区分方法收益与训练随机性。

6.7 机制证据有说服力,但不是唯一解释

屏蔽反思词分叉、比较熵方向和做长度匹配都支持“在关键分叉重塑分布”的解释。不过反思词集合是人工定义的代理指标,4-gram Jaccard distance 不测语义多样性,负优势也会同时改变长度偏好、校准和停止概率。完整因果链仍需要更直接的分支级干预与概率流追踪。

7. 应用影响与工程启示

7.1 降低 on-policy 后训练对教师的基础设施依赖

如果后续实验确认可扩展性,OPSA 可省去大教师部署、师生共享 tokenizer 和教师全轨迹 forward pass。对于已有可 rollout 的开源模型,训练栈只需要从 actor 本身导出 token logp 与 entropy,因而更容易嵌入现有 RL 框架。

7.2 把 token 级不确定性变成可用训练信号

传统自训练通常先构造伪答案,再判断整条轨迹;OPSA 说明模型内部的局部不确定性也能形成 dense signal。这个方向可推广到 verifier 稀缺的领域,但前提是监控策略坍塌、长度漂移、校准变化与领域外退化,不能把“无标签”误解为“无需验收”。

7.3 作为有监督 RL 的冷启动,而非必然替代品

附录将 Qwen3-4B 的 OPSA checkpoint 继续用于 GRPO,验证集 Avg@4 在 40 步后再提高约 9 点且曲线稳定。这提示 OPSA 更现实的角色可能是先整理策略分布、降低无效 tail 分支,再由可验证奖励扩张正确解空间,而不是完全取代所有外部反馈。

7.4 推理服务需要配套长度治理

部署时应把准确率、Pass@k、平均输出长度、P95 延迟与每题成本放在同一评估表中。对高难推理可允许 OPSA 诱导的长链;对简单请求则需要难度路由、最大 token、答案置信度或自适应停止策略,避免把训练收益转化成持续的 serving 成本。

7.5 对知识蒸馏研究的更广影响

论文最值得延续的问题不是“OPD 无效”,而是蒸馏目标可能同时包含两种作用:

  • 知识迁移:教师在学生不确定处提供内容相关偏好;
  • 策略整形:reverse-KL 形式系统性压低学生采到的低概率 token。

未来对 OPD 的评估应把这两种作用拆开,加入无教师负优势、随机教师、匹配 KL/熵变化等控制组。只有超过这些 policy-shaping 基线的部分,才更能归因于教师知识。

8. 相关工作与定位

8.1 On-Policy Distillation

GKD 将学生生成轨迹与监督轨迹纳入灵活的散度目标,MiniLLM 用 reverse KL 缓解 exposure bias;后来的 OPD 工作用 K1 estimator 为推理任务提供高效逐 token 信号。TIP、Trust Region OPD、位置偏差与 dual exposure bias 等研究继续处理 token 选择、信用分配和师生错位。OPSA 与它们的差别是:它不修补教师信号,而是追问哪些收益不需要教师,并将其提炼成独立算法。

8.2 On-Policy Self-Distillation

Self-Distilled Reasoner、Reinforcement Learning via Self-Distillation 等方法让同一模型在 reference answer、hint 或不同 thinking 条件下扮演教师,减少外部模型依赖。它们仍通过条件化后的“教师分布”给学生轨迹打分。OPSA 不构造教师分布,直接从未条件化策略自身的 logp 与熵得到优势。

8.3 Label-Free Policy Improvement

Self-Rewarding LM 用模型充当 judge,TTRL、EMPO 用多数投票或聚类推断伪答案,Intuitor 用 trajectory-level self-certainty 构造奖励。这些方法可能把已有错误 mode 进一步强化。OPSA 不选择某个完整答案作为伪真值,而在 token 层面对低概率采样施加负优势,试图同时改善低熵精度和高熵分叉探索。

8.4 Negative Sample Reinforcement

NSR 对可验证为错误的整条轨迹分配固定负优势,也证明“只学负样本”可以提升推理。OPSA 的区别有两点:不需要先知道轨迹是否错误,并把负信号细化到所有轨迹中的低 logp token,再由位置熵调节强度。论文在 Qwen3-1.7B 上报告 OPSA 的平均 Avg@32 / Pass@32 为 35.83 / 65.56,高于 NSR 的 24.13 / 58.89。

9. 结论

这篇论文给 On-Policy Distillation 提出了一次重要的机制审计。教师在学生前缀上的信号可以高度嘈杂,学生却不依赖过滤这些噪声而进步;真正产生梯度的主要是学生自己采到的低 logp token,而固定负优势已经能复现大量收益。这个证据链把 OPD 的一部分效果从“教师知识迁移”重新解释为“学生策略分布整形”。

OPSA 将这一观察变成了简洁方法:训练每条响应最低 logp 的 20%,用位置熵把负优势调节在 0.5-0.51.0-1.0 之间。它在 Qwen3-1.7B、4B 与 Qwen3.5-9B 上显著提高数学推理,并在代码和科学问答上获得较小增益;相比 GRPO、OPD、OPSD 和 TTRL,它无需任务级外部反馈,训练步也更快。

不过,现有证据还不能支持“教师蒸馏没有价值”或“无监督自适应可替代 RLVR”的强结论。噪声定义只覆盖答案 token,实验限于一个模型家族和 9B 以下规模,主要收益集中在数学域,推理长度与成本明显上升。OPSA 当前最可信的定位,是一种有力的 teacher-free policy-shaping 基线和潜在 RL 冷启动:它迫使后续蒸馏工作证明,增益中究竟有多少真的来自教师,而不是目标函数自带的尾部抑制效应。

参考资料

  1. Hugging Face Daily Papers:https://huggingface.co/papers
  2. Hugging Face 论文详情:https://huggingface.co/papers/2608.31046
  3. arXiv 摘要页:https://arxiv.org/abs/2608.31046
  4. arXiv HTML 全文:https://arxiv.org/html/2608.31046v1
  5. arXiv PDF:https://arxiv.org/pdf/2608.31046
  6. 官方项目页:https://dripnowhy.github.io/On-Policy-Self-Adaptation/
  7. 官方代码仓库:https://github.com/DripNowhy/On-Policy-Self-Adaptation
  8. On-Policy Distillation(Thinking Machines Lab):https://thinkingmachines.ai/blog/on-policy-distillation/
  9. Self-Distilled Reasoner:https://arxiv.org/abs/2601.18734
  10. TIP: Token Importance in On-Policy Distillation:https://arxiv.org/abs/2604.14084
  11. The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning:https://arxiv.org/abs/2506.01347
  12. Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning:https://arxiv.org/abs/2506.01939