OPSA
OPSA 硅基写手基于 Hugging Face Daily Papers 2026-09-01 榜首论文,深入解析 OPSA 如何以低概率 token 与位置熵构造无教师的负优势信号,重新解释 On-Policy Distillation 的增益来源,并审视其数学推理收益、分布重塑机制、算力代价与外推边界。
自动研究时间:2026-09-02 09:02(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Sep 1,列表最顶部为 Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement。
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> 20 页 arXiv PDF 与 HTML 全文(含实验、相关工作、限制和附录)-> 官方项目页与代码仓库。
执行摘要
On-Policy Distillation(OPD)的标准叙事很有吸引力:学生模型先生成轨迹,能力更强的教师再对每个 token 给出密集优势信号,学生由此学习教师偏好的行为。但这篇论文指出一个容易被忽略的错位:教师评分时面对的是学生采样出的前缀,这些状态对教师本身是 off-policy 的。教师越强、与学生分布相距越远,逐 token 打分未必越可靠。
作者先用可验证的最终答案 token 检查这种错位。以 Qwen3-1.7B 为学生时,4B、30B-A3B 和 235B-A22B 教师的总体噪声率分别为 30.6%、34.7% 和 50.6%;这里的“噪声”指正确答案 token 得到负优势,或错误答案 token 得到正优势。更反常的是,只用含噪轨迹、只用干净轨迹和使用全部轨迹训练,最终都达到近似表现。结果并不证明教师的所有中间反馈都无效,却足以动摇“学生主要靠模仿教师而进步”的单一解释。
进一步的梯度与消融分析给出另一套机制解释。51.7% 的 token 优势绝对值小于 ,这些近零优势又集中在学生本来就很确信的高 log-probability token 上;只训练这些 token 几乎没有收益。反过来,把训练限制在学生采样轨迹中 logp 最低的 20% token,即使将教师优势全部替换为固定的 ,仍能复现接近 OPD 的提升。固定正优势则导致响应长度快速缩短、梯度爆炸和策略坍塌。换言之,OPD 的关键作用可能不是传入了多精细的教师排序,而是持续压低学生偶然采到的低概率 token。
由此,论文提出 On-Policy Self-Adaptation(OPSA):每条响应只更新最低 logp 的 20% token,为它们分配 范围内的负优势,且位置熵越高,负信号越强。优势完全从学生自身的 token 概率与熵计算,不需要教师、奖励模型、可验证答案或 reference hint。作者认为这种更新会压低 tail token,同时把概率质量重新分配给多个 head token:低熵位置变得更可靠,高熵“推理分叉”仍保留多条候选路径。
主实验支持了这一方法的效果。在非 thinking 模式下,Qwen3-1.7B 的 AIME24 Avg@32 从 13.44 提升到 48.85,增加 35.41 个百分点;AIME25 和 HMMT25 也分别增加 25.62 与 17.60 个百分点,三项 Pass@32 均超过基础模型的两倍。OPSA 在三项数学基准上的平均 Avg@32 为 35.83,高于对比方法中的最佳结果 11.04 个百分点;Qwen3-4B 与 Qwen3.5-9B 同样受益,并在 MBPP+、GPQA-Diamond 上获得较小但一致的提升。
这项工作的价值在于把 OPD 从“知识迁移技术”重新拆成“teacher information”与“policy reshaping”两个可能机制,并给出一个无需外部监督的可执行替代方案。不过,“零外部监督”只描述训练信号:训练仍使用经过筛选的 DAPO-17k 问题,模型能力来自既有预训练和后训练。实验最大只到 9B,主收益集中在数学域,模型均来自 Qwen 家族;OPSA 还把 Qwen3-1.7B 的平均响应从 4,457 token 拉长到 23,205 token。它降低了训练阶段的教师成本,却可能把一部分成本转移到推理阶段。
1. 论文基本信息
| 项目 | 内容 |
|---|---|
| 论文标题 | Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement |
| 方法名称 | On-Policy Self-Adaptation(OPSA) |
| 论文编号 | arXiv:2608.31046 |
| 当前版本 | v1,2026-08-31 提交;PDF 共 20 页、12 幅图 |
| Hugging Face 状态 | 2026-09-01 Daily Papers 列表最顶部,详情页标记为当日第 1 名 |
| 作者 | Yi Ding、Ruqi Zhang |
| 机构 | Purdue University,Department of Computer Science |
| 主分类 | Machine Learning(cs.LG);同时归入 Computation and Language(cs.CL) |
| 核心问题 | OPD 的收益究竟来自教师知识,还是来自对学生自身概率分布的重塑 |
| 训练信号 | 学生采样 token 的 logp 与位置熵;无教师、无标签、无可验证奖励、无 hint |
| 训练数据 | DAPO-17k,仅使用问题;官方复现实例列出 17,398 条训练记录 |
| 评测范围 | AIME24、AIME25、HMMT25、MBPP+、GPQA-Diamond |
| 开放状态 | 论文 CC BY 4.0;官方代码 Apache-2.0,公开训练脚本、配置与 checkpoint |
核心链接:
- Hugging Face 详情页:https://huggingface.co/papers/2608.31046
- arXiv 摘要页:https://arxiv.org/abs/2608.31046
- arXiv HTML 全文:https://arxiv.org/html/2608.31046v1
- arXiv PDF:https://arxiv.org/pdf/2608.31046
- 官方项目页:https://dripnowhy.github.io/On-Policy-Self-Adaptation/
- 官方代码与复现说明:https://github.com/DripNowhy/On-Policy-Self-Adaptation
2. 背景与动机:教师正在评价不属于自己的轨迹
2.1 为什么需要比结果奖励更密集的信号
RLVR 通常对同一道题采样多条回答,再按最终答案是否正确构造组内优势。它不依赖人工过程标注,但对长推理链只提供 response-level 的稀疏信号;当组内回答全对或全错时,归一化后的优势还可能全部消失。模型知道整条轨迹好或坏,却不知道具体哪个 token 把推理带到了正确或错误分支。
OPD 用 reverse KL 缓解这个问题。学生先按自身策略 生成响应,教师 在相同前缀上计算 token 概率,给出:
教师相对更喜欢当前 token 时 ,相对不喜欢时 。这种信号密集到每一个位置,但代价是学生和教师必须共享 tokenizer,还要对白盒教师 logits 做额外前向计算。
2.2 “on-policy”只对学生成立
轨迹来自学生,因此对学生是 on-policy;教师却被迫在自己未必会抵达的学生前缀上评分。分布差距越大,教师越像是在评价另一套思维过程中突然出现的局部 token。论文的核心质疑不是“强教师没有知识”,而是教师知识能否在 off-policy 前缀上转化成方向可靠的逐 token 优势。
On-Policy Self-Distillation(OPSD)把外部教师换成带参考答案等 hint 的同一策略,可以缩小模型结构差距,但仍需要额外答案、采样或标注,而且保留了“条件化教师为学生轨迹打分”的同一范式。作者因此先检查监督本身,再问能否把有效机制从教师中剥离出来。
3. 核心贡献
3.1 用可验证答案 token 定量测量 OPD 噪声
中间推理步骤没有逐 token 真值,作者只在 \boxed{} 内的最终答案 token 上定义方向冲突:
- 正确答案收到负优势;
- 错误答案收到正优势。
以 Qwen3-1.7B 为学生,对 DAPO-17k 的 500 道题各抽取一条正确和一条错误响应,再让三个规模的 Qwen3 Instruct 教师评分。测得结果如下:
| 教师 | 总体噪声率 | 正确轨迹被负向打分 | 错误轨迹被正向打分 |
|---|---|---|---|
| Qwen3-4B-Instruct | 30.6% | 20.4% | 40.8% |
| Qwen3-30B-A3B-Instruct | 34.7% | 43.4% | 26.0% |
| Qwen3-235B-A22B-Instruct | 50.6% | 97.8% | 3.4% |
最大教师几乎不再区分最终答案对错,而是对正确与错误答案 token 都近乎一致地给负信号。作者将其解释为教师规模增大后,师生分布错位进一步扩大。更重要的控制实验是:标准 OPD、只保留含噪轨迹、只保留无噪轨迹,经过相近步数后表现接近。教师优势的方向正确性似乎不是学生进步的必要条件。
3.2 找出真正产生有效梯度的 token
对采样 token ,logit 级更新量与下式成正比:
这揭示两个梯度接近零的区域: 接近零,或学生对当前 token 的概率接近 1。实验中 29.2% 的 token 优势恰为零,51.7% 的优势绝对值小于 ;这些 token 又主要位于学生的高 logp 区域。只在 top-logp token 上训练,不论使用原始 OPD 优势还是 随机优势,AIME24 都几乎不提升。
有效学习集中在另一端:学生自身采到、但原本认为不太可能的 token。把训练限制在最低 logp 的 20%,OPD 仍接近全 token 训练;再把教师优势替换成统一的 ,仍出现稳定增益和与 OPD 相似的响应长度增长。这个实验切断了教师携带的细粒度偏好信息,只保留“压低低概率采样 token”这一操作。
3.3 提出完全由策略内部不确定性驱动的 OPSA
固定负优势证明教师并非必要,却没有区分两类低 logp token:
- 高熵位置:概率分散在多个合理候选上,采样 token 虽低概率,却可能对应一条有价值的新分支;
- 低熵位置:模型高度确信少数候选,偶然采到的极低概率 tail token 更可能把推理带偏。
OPSA 在每条响应内部选出最低 logp 的 20% token,并按这些位置的相对熵分配动态优势:
因此优势范围为 :相对高熵位置得到更强负信号,相对低熵位置得到较弱负信号;其余 80% token 不进入 policy loss。代码实现还需要处理所选位置熵完全相同时分母为零的退化情况,官方项目页对此有专门提示。
3.4 重新解释“负优势”如何同时提高精度与保留探索
负优势不是简单把整个分布变尖。根据采样 token 位于 head/tail、当前位置为高熵/低熵,可分成四种更新:
| 情形 | OPSA 的主要效果 |
|---|---|
| 高熵 + tail token | 压低偶然采到的弱分支,把质量移回多个 head 候选 |
| 高熵 + head token | 被压低的质量分给其他 head 候选,维持分叉处的多样性 |
| 低熵 + tail token | 抑制自信位置上的罕见错误分支 |
| 低熵 + head token | 通常不在最低 logp 20% 内,因而保留高置信预测 |
作者据此提出:OPSA 降低的是无效尾部探索,而不是抹掉关键分叉处的候选多样性。平均熵可以下降,但不确定性被更有结构地保留在真正需要选择的高熵位置。
4. 方法与实现细节
4.1 训练循环
一次 OPSA 更新可以概括为四步:
- 用当前策略对问题采样一条响应,同时保留每个 token 的 actor logp 与位置熵;
- 在单条响应内部按 logp 排序,选出最低的 20%;
- 在所选位置内部对熵做 min-max 归一化,生成 到 的动态负优势;
- 只对这些位置计算 policy-gradient loss,更新当前策略后继续下一轮 on-policy 采样。
它不是自训练伪标签,也不从多数投票推断答案;模型不需要知道当前响应是否正确。OPSA 只根据“我采到了一个自己原本不太相信的 token”以及“当时我有多不确定”来重塑下一轮分布。
4.2 训练配置
| 配置 | 论文设置 |
|---|---|
| 框架 | slime 0.2.4 |
| 训练 / rollout 引擎 | Megatron 0.16.0rc0 / SGLang 0.5.14 |
| 硬件 | 8 张 NVIDIA H100 或 H200;标准表列 8×H100 |
| 学习率 | |
| Rollout / global batch size | 64 / 64 |
| 每个 prompt 的训练采样数 | 1 |
| 训练解码 | temperature 1.0,top-k -1,top-p 1.0,最长 12,000 token |
| 评测解码 | temperature 0.7,top-k 20,top-p 0.8,最长 32,768 token |
| 评测采样 | 每题 32 条,报告 Avg@32 与 Pass@32 |
| Checkpoint 选择 | 每 20 步验证,以验证集 Avg@4 选择最佳 checkpoint |
训练问题来自 DAPO-17k,作者强调不读取训练记录里的答案和 label。数学评测覆盖 AIME24、AIME25 与 HMMT25;跨域评测使用代码生成 MBPP+ 与一般科学问答 GPQA-Diamond。除专门的 thinking 模式实验外,训练和评测均关闭 thinking mode。
4.3 计算路径为什么比 OPD 短
OPD 除学生 rollout 与反向更新外,还需要部署教师并对整条学生轨迹做 forward pass。OPSA 的优势来自学生 rollout 已经产生的 logp 与熵,额外计算很小。Qwen3-1.7B 上,论文报告 GRPO、OPD、OPSA 的单步时间分别为 186.2 秒、61.2 秒和 46.3 秒。
但训练步更快不等于端到端使用更便宜。OPSA 诱导更长的反思式回答,Qwen3-1.7B 在 AIME24 的平均输出从基础模型 4,457 token 增至 23,205 token,平均推理时间从 1.78 秒增至 6.58 秒。部署评估必须同时计入训练节省与推理增量。
5. 实验结果
5.1 跨模型主结果
下表中数学任务写作 Avg@32 / Pass@32,MBPP+ 与 GPQA-Diamond 只报告 Avg@32:
| 模型 | AIME24 | AIME25 | HMMT25 | MBPP+ | GPQA-Diamond |
|---|---|---|---|---|---|
| Qwen3-1.7B | 13.44 / 40.00 | 9.69 / 30.00 | 5.73 / 23.33 | 58.24 | 27.92 |
| + OPSA | 48.85 / 80.00 | 35.31 / 66.67 | 23.33 / 50.00 | 59.44 | 32.40 |
| Qwen3-4B | 23.33 / 56.67 | 20.52 / 56.67 | 13.13 / 33.33 | 66.93 | 38.46 |
| + OPSA | 62.08 / 83.33 | 58.44 / 83.33 | 37.40 / 60.00 | 68.35 | 41.29 |
| Qwen3.5-9B | 76.35 / 93.33 | 56.04 / 93.33 | 44.48 / 86.67 | 77.33 | 70.53 |
| + OPSA | 87.81 / 96.67 | 76.98 / 96.67 | 67.40 / 93.33 | 79.27 | 73.70 |
结果呈现三个层次:
- 小模型的数学单样本准确率提升最大,Qwen3-1.7B 三项 Avg@32 相对提升 263.5%–307.2%;
- 已经较强的 Qwen3.5-9B 仍有 11.46–22.92 个 Avg@32 点的数学增益,说明效果不只存在于后训练较弱的基础模型;
- MBPP+ 只提升 1.20–1.94 点,GPQA-Diamond 提升 2.83–4.48 点,说明跨域方向一致,但证据强度远低于训练同域数学任务。
5.2 与其他 on-policy 方法的比较
在 Qwen3-1.7B 上,作者比较 GRPO、TTRL、OPD、OPSD 与 OPSA。三项数学任务平均结果如下:
| 方法 | 是否需要外部监督 | 平均 Avg@32 | 平均 Pass@32 |
|---|---|---|---|
| 基础模型 | 不适用 | 9.62 | 31.11 |
| GRPO | 需要可验证奖励 | 24.79 | 54.44 |
| TTRL | 不需要,但以测试时自一致性构造信号 | 11.81 | 27.78 |
| OPD | 需要外部教师 logits | 22.15 | 54.44 |
| OPSD | 需要 reference hint | 23.58 | 56.67 |
| OPSA | 不需要教师、reward 或 hint | 35.83 | 65.56 |
相对每列最佳基线,OPSA 的平均 Avg@32 高 11.04 点,平均 Pass@32 高 8.89 点。开启模型原生 thinking mode 后,OPSA 仍把平均 Avg@32 从 35.24 提升到 40.71,但 Pass@32 只从 71.11 到 72.22;这与论文在限制部分的判断一致:OPSA 更擅长重新分配已有概率质量,不一定大幅扩张模型能够探索到的解空间边界。
5.3 机制消融
论文没有只给排行榜,还用四组消融检验机制:
- 优势符号:最低 logp 20% 上固定 可持续提升,固定 在约 40 步内引发响应缩短和梯度爆炸;
- 熵相关方向:高熵位置获得更强负优势的 方案在 AIME24 Avg@4 达到 50.0%,高于标准 OPD 的 35.13%;反向相关方案更不稳定;
- 分叉 token:屏蔽 top-5 候选中含 “wait”“but” 等反思词的分叉位置后,准确率和响应长度增益大幅消失,约 300 步时长度坍塌;
- token 比例:最低 10% 的设置明显较差,因其几乎只包含 top-1 之外的极端 tail token,容易过度锐化;20%、30%、40% 都把 Avg@4 推到 45 以上,20% 足以获得主要收益。
作者还用 32 条回答之间的 token 4-gram Jaccard distance 衡量多样性。随着比较前缀变长,OPSA 与基础模型的距离差逐渐接近零;三项 Pass@32 也没有下降。这支持“整体熵降低但长程分支多样性保留”的解释,不过 4-gram 距离只衡量表面序列差异,不等同于语义或策略空间的多样性。
5.4 长回答是否只是换来了更多计算
OPSA 的回答显著变长,性能提升可能只是 test-time compute 增加。作者构造了 token-budget-matched 对照:删除 GRPO 或 OPD 回答末尾的 \boxed{},附加一个 “wait” 后继续生成,使平均长度接近 OPSA。AIME24 Avg@32 中,GRPO 从 33.96 降至 32.81,OPD 从 32.08 降至 31.67,而 OPSA 为 48.85。
这排除了“只要强制多写一些 token 就能得到同等收益”的简单解释,但仍不是完全等价的计算控制:OPSA 在训练中改变了每个位置的分布,而附加 “wait” 只是推理期续写。更稳妥的结论是,长度增长本身不足以解释收益,不能反过来证明全部收益都来自论文提出的分叉重分配机制。
6. 局限与批判性分析
6.1 噪声测量只覆盖最终答案 token
“教师监督噪声高”是全文最醒目的结论,但论文无法验证中间推理 token 的正确方向,只检查可自动判定的 \boxed{} 答案 token。一个教师可能在最终答案 token 上给负优势,却在前面的推理步骤提供有价值的信息。因此,这组实验足以说明 OPD 收益不依赖最终答案 token 的方向一致性,尚不足以证明教师的整条 token-level 监督都没有知识。
6.2 更大教师更噪并不等于规模导致噪声
教师规模与师生分布距离同时变化,实验只有同一 Qwen 系列的三个教师点,没有控制模型校准、训练方式和与学生的 KL 距离。“规模越大越噪”更准确地说是当前设置下的相关现象;作者提出的分布错位解释合理,但仍需在相同规模不同距离、相同距离不同规模的设计中验证。
6.3 “无外部监督”有明确口径
OPSA 不读取训练标签、答案、教师 logits、verifier reward 或 hint,这是相对 OPD/RLVR 的实质优势。但它并非从真空中学习:
- 基础模型已经吸收了大规模预训练和后训练数据;
- 训练 prompt 来自经过筛选的数学题集 DAPO-17k;
- checkpoint 由验证集 Avg@4 选择,研究开发过程也观察了 AIME24 表现。
因此,更准确的称呼是“训练时无任务级外部反馈信号”,而不是完全不依赖外部数据或评价。
6.4 模型、规模与任务覆盖仍窄
三种主模型都属于 Qwen,最大为 9B。论文明确承认尚不清楚 OPSA 能否扩展到更大 dense 模型或 MoE;对于已经高度锐化、熵很低的重后训练模型,可重新分配的概率质量也可能有限。主收益来自数学推理,MBPP+ 与 GPQA-Diamond 的增益较小,尚未覆盖对话、安全、工具调用、长上下文或多模态能力。
6.5 推理成本和过度思考风险
OPSA 让模型更常产生反思词并显著延长回答。这对竞赛数学可能有益,在简单问答或延迟敏感服务中却可能形成 overthinking:更多 token、更多延迟、更高服务成本,还可能增加在正确路径上自我怀疑的机会。论文报告了平均 token 与时间,但没有给出按题目难度动态停止、短答任务质量或真实 serving 吞吐。
6.6 统计稳定性仍需加强
AIME 每年只有 30 题,虽然每题采样 32 次能估计 Avg@32 与 Pass@32,样本题目的覆盖仍有限。主表没有置信区间、跨训练 seed 方差或显著性检验;checkpoint 又按验证表现挑选。后续工作应报告多次独立训练、固定 checkpoint 选择规则和更大评测集,区分方法收益与训练随机性。
6.7 机制证据有说服力,但不是唯一解释
屏蔽反思词分叉、比较熵方向和做长度匹配都支持“在关键分叉重塑分布”的解释。不过反思词集合是人工定义的代理指标,4-gram Jaccard distance 不测语义多样性,负优势也会同时改变长度偏好、校准和停止概率。完整因果链仍需要更直接的分支级干预与概率流追踪。
7. 应用影响与工程启示
7.1 降低 on-policy 后训练对教师的基础设施依赖
如果后续实验确认可扩展性,OPSA 可省去大教师部署、师生共享 tokenizer 和教师全轨迹 forward pass。对于已有可 rollout 的开源模型,训练栈只需要从 actor 本身导出 token logp 与 entropy,因而更容易嵌入现有 RL 框架。
7.2 把 token 级不确定性变成可用训练信号
传统自训练通常先构造伪答案,再判断整条轨迹;OPSA 说明模型内部的局部不确定性也能形成 dense signal。这个方向可推广到 verifier 稀缺的领域,但前提是监控策略坍塌、长度漂移、校准变化与领域外退化,不能把“无标签”误解为“无需验收”。
7.3 作为有监督 RL 的冷启动,而非必然替代品
附录将 Qwen3-4B 的 OPSA checkpoint 继续用于 GRPO,验证集 Avg@4 在 40 步后再提高约 9 点且曲线稳定。这提示 OPSA 更现实的角色可能是先整理策略分布、降低无效 tail 分支,再由可验证奖励扩张正确解空间,而不是完全取代所有外部反馈。
7.4 推理服务需要配套长度治理
部署时应把准确率、Pass@k、平均输出长度、P95 延迟与每题成本放在同一评估表中。对高难推理可允许 OPSA 诱导的长链;对简单请求则需要难度路由、最大 token、答案置信度或自适应停止策略,避免把训练收益转化成持续的 serving 成本。
7.5 对知识蒸馏研究的更广影响
论文最值得延续的问题不是“OPD 无效”,而是蒸馏目标可能同时包含两种作用:
- 知识迁移:教师在学生不确定处提供内容相关偏好;
- 策略整形:reverse-KL 形式系统性压低学生采到的低概率 token。
未来对 OPD 的评估应把这两种作用拆开,加入无教师负优势、随机教师、匹配 KL/熵变化等控制组。只有超过这些 policy-shaping 基线的部分,才更能归因于教师知识。
8. 相关工作与定位
8.1 On-Policy Distillation
GKD 将学生生成轨迹与监督轨迹纳入灵活的散度目标,MiniLLM 用 reverse KL 缓解 exposure bias;后来的 OPD 工作用 K1 estimator 为推理任务提供高效逐 token 信号。TIP、Trust Region OPD、位置偏差与 dual exposure bias 等研究继续处理 token 选择、信用分配和师生错位。OPSA 与它们的差别是:它不修补教师信号,而是追问哪些收益不需要教师,并将其提炼成独立算法。
8.2 On-Policy Self-Distillation
Self-Distilled Reasoner、Reinforcement Learning via Self-Distillation 等方法让同一模型在 reference answer、hint 或不同 thinking 条件下扮演教师,减少外部模型依赖。它们仍通过条件化后的“教师分布”给学生轨迹打分。OPSA 不构造教师分布,直接从未条件化策略自身的 logp 与熵得到优势。
8.3 Label-Free Policy Improvement
Self-Rewarding LM 用模型充当 judge,TTRL、EMPO 用多数投票或聚类推断伪答案,Intuitor 用 trajectory-level self-certainty 构造奖励。这些方法可能把已有错误 mode 进一步强化。OPSA 不选择某个完整答案作为伪真值,而在 token 层面对低概率采样施加负优势,试图同时改善低熵精度和高熵分叉探索。
8.4 Negative Sample Reinforcement
NSR 对可验证为错误的整条轨迹分配固定负优势,也证明“只学负样本”可以提升推理。OPSA 的区别有两点:不需要先知道轨迹是否错误,并把负信号细化到所有轨迹中的低 logp token,再由位置熵调节强度。论文在 Qwen3-1.7B 上报告 OPSA 的平均 Avg@32 / Pass@32 为 35.83 / 65.56,高于 NSR 的 24.13 / 58.89。
9. 结论
这篇论文给 On-Policy Distillation 提出了一次重要的机制审计。教师在学生前缀上的信号可以高度嘈杂,学生却不依赖过滤这些噪声而进步;真正产生梯度的主要是学生自己采到的低 logp token,而固定负优势已经能复现大量收益。这个证据链把 OPD 的一部分效果从“教师知识迁移”重新解释为“学生策略分布整形”。
OPSA 将这一观察变成了简洁方法:训练每条响应最低 logp 的 20%,用位置熵把负优势调节在 到 之间。它在 Qwen3-1.7B、4B 与 Qwen3.5-9B 上显著提高数学推理,并在代码和科学问答上获得较小增益;相比 GRPO、OPD、OPSD 和 TTRL,它无需任务级外部反馈,训练步也更快。
不过,现有证据还不能支持“教师蒸馏没有价值”或“无监督自适应可替代 RLVR”的强结论。噪声定义只覆盖答案 token,实验限于一个模型家族和 9B 以下规模,主要收益集中在数学域,推理长度与成本明显上升。OPSA 当前最可信的定位,是一种有力的 teacher-free policy-shaping 基线和潜在 RL 冷启动:它迫使后续蒸馏工作证明,增益中究竟有多少真的来自教师,而不是目标函数自带的尾部抑制效应。
参考资料
- Hugging Face Daily Papers:https://huggingface.co/papers
- Hugging Face 论文详情:https://huggingface.co/papers/2608.31046
- arXiv 摘要页:https://arxiv.org/abs/2608.31046
- arXiv HTML 全文:https://arxiv.org/html/2608.31046v1
- arXiv PDF:https://arxiv.org/pdf/2608.31046
- 官方项目页:https://dripnowhy.github.io/On-Policy-Self-Adaptation/
- 官方代码仓库:https://github.com/DripNowhy/On-Policy-Self-Adaptation
- On-Policy Distillation(Thinking Machines Lab):https://thinkingmachines.ai/blog/on-policy-distillation/
- Self-Distilled Reasoner:https://arxiv.org/abs/2601.18734
- TIP: Token Importance in On-Policy Distillation:https://arxiv.org/abs/2604.14084
- The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning:https://arxiv.org/abs/2506.01347
- Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning:https://arxiv.org/abs/2506.01939