本页目录 Rethinking Cross-Tokenizer OPD

Rethinking Cross-Tokenizer OPD

这项研究重新审视跨分词器在线策略蒸馏:三组异构模型中,严格一对一位置已覆盖大多数学生 token,共享词表也承载近乎全部概率质量;学生侧 top-16 支持即可保留至少 96% 的蒸馏增益,而补齐错配跨度监督反而因梯度弱对齐而降低准确率。

论文基本信息

  • 题目:Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability
  • 作者:Bingxi Hou、Guochao Jiang、Guofeng Quan、Weiqing Li、Wenfeng Feng、Guohua Liu、Yuewei Zhang
  • 机构:Alibaba Cloud Computing
  • arXiv:2610.08448v1,2026 年 10 月 6 日提交,类别 cs.CL、cs.AI
  • Daily Papers:Hugging Face 页面 2026 年 10 月 7 日榜首
  • 研究对象:不同 tokenizer 的大语言模型之间如何进行 On-Policy Distillation(OPD)
  • 链接:Hugging Face 详情页;arXiv 摘要页;arXiv HTML 全文;arXiv PDF 全文;匿名代码仓库

一句话结论

跨分词器 OPD 的主要瓶颈未必是“能对齐多少”:三组异构 teacher–student 中,严格一对一位置已经覆盖 85.57% 至 96.98% 的学生 token,共享词表在这些位置保留约 99% 的预测概率;只在学生选出的 16 个共享高概率 token 上做 reverse KL,仍可保留完整严格蒸馏至少 96% 的增益,而用 span log-probability MSE 补齐所有错配跨度,在 18 个正权重设置中全部降低综合准确率。真正需要优化的是监督是否可靠,而非结构覆盖率是否达到 100%。

背景与动机

传统知识蒸馏让小模型模仿大模型。On-Policy Distillation 的特殊之处是:训练样本不是固定教师数据,而是学生当前策略自己生成的轨迹;教师再对学生真正访问到的 prefix 提供逐 token 分布监督。相比只在离线答案上训练,这种方式能把教师信号送到学生正在犯错的状态。

当师生共享 tokenizer 时,在同一位置比较两个 next-token distribution 很直接。跨模型家族蒸馏则同时遭遇两层不一致:

  1. 序列边界不同。 同一字符串可能在一侧是一个 token,在另一侧是多个 token,导致 autoregressive 决策位置无法逐项对应。
  2. 词表不同。 即使两侧恰好在同一文本边界预测,它们的 softmax 定义在不同 vocabulary 上,不能直接计算 KL divergence。

已有研究通常把这两层差异视为必须尽可能填满的“监督缺口”。ULD 比较排序后的概率,DSKD、CDM 等学习表示或词表映射,span 方法聚合多 token 路径,byte-level 方法则把比较接口下沉到字节。直觉是:可比较位置越多、覆盖词表越大,可利用的教师知识越完整。

本文质疑的正是这一直觉。静态词表 Jaccard 把每个词表项等权计算,却没有回答这些项在学生真实轨迹上出现多频繁、预测概率有多大;序列上能够把两个 token group 拼成同一文本跨度,也不意味着对两条不同长度的 autoregressive 路径施加某个标量损失就会产生可靠梯度。作者因此把问题从“多少监督可以被构造出来”改写为“构造出的监督是否真正改善学生学习”。

核心贡献

  1. 在三组 tokenizer 差异显著的 teacher–student 上同时测量静态词表重合、学生轨迹上的动态严格覆盖和预测概率质量,证明静态 mismatch 会严重高估实际监督缺口。
  2. 建立一个清晰的严格基线:只在师生各用一个 token 覆盖同一文本跨度的位置上,将两个分布限制并重新归一化到共享词表,再计算 reverse KL。
  3. 用 span log-probability MSE 为所有 mismatch group 增加监督,使结构覆盖达到 100%;但 3 组模型、6 个正权重合计 18 个设置全部低于各自的严格基线。
  4. 提出 student-selected top-k 严格蒸馏:每个严格位置仅保留学生在共享词表中概率最高的 token。k = 16 已保留双方绝大多数概率质量,并保留完整严格 OPD 至少 96% 的综合增益。
  5. 用梯度 cosine 与 norm ratio 解释 span 监督的负收益:错配跨度梯度与严格目标方向接近正交、部分阶段相反,其相对幅度却随训练增长。
  6. 通过更大的 235B teacher 和 ALFWorld 交互任务补充验证,显示紧凑严格监督的优势不只出现在三组主实验的数学与代码平均分上。

方法:先区分“能对齐”与“值得学”

1. 从学生文本构造 token group

对提示 x,学生策略生成字符串响应 y。论文用师生各自的 tokenizer 对这段已经解码的相同字符串重新分词,找到两边共享的字符或字节边界;相邻共享边界之间形成一对 token group。两边 group 拼接出的文本完全相同,但 token 数量可能不同。

  • Strict 1:1 group:学生侧和教师侧各只有一个 token,且覆盖同一文本跨度;
  • Mismatch group:至少一侧需要多个 token,例如 1:2、2:1 或多对多。

这里的严格对齐不是 token ID 相同,而是两个单 token 的底层文本一致、决策边界一致。论文进一步按底层 token 内容匹配两个 vocabulary,排除特殊 token 和有歧义的映射,得到共享词表 V∩。

2. Strict Cross-Tokenizer OPD

在每个 strict position,师生 next-token distribution 分别被限制到 V∩ 并重新归一化,然后最小化 student-to-teacher reverse KL:

L_strict = E[ Σ KL(p_student(. | prefix_s) || p_teacher(. | prefix_t)) ]

它只使用一对一位置,也只比较共享词表。这个目标看起来丢失了两部分信息:mismatch group 完全不参与;非共享词表项也被排除。本文接下来的实验正是判断这两部分“丢失”在真实学生轨迹上究竟有多大。

3. 用 span MSE 补齐结构覆盖

对于 mismatch group,师生都能计算“生成各自 token path 后得到同一文本跨度”的联合概率。设两侧路径概率分别为 q_student 和 q_teacher,作者加入 log-probability MSE:

L_span = E[ Σ (log q_student - log q_teacher)^2 ]
L_total = L_strict + λ L_span

只要 λ > 0,所有 mismatch group 都获得损失,结构监督覆盖即达到 100%。作者对三组模型统一扫描 λ ∈ {0, 0.25, 0.5, 0.75, 1.0, 1.25, 1.5}。关键控制是:严格目标始终不变,只增加 span 项,因此性能差异能直接回答新增监督是否有价值。

4. 用 student-selected top-k 压缩分布支持

在严格位置上,作者不再使用整个共享词表,而是选出学生分布在 V∩ 中概率最高的 k 个 token;师生都在同一子集上重新归一化,再计算 reverse KL。主实验比较 k = 16、k = 128 和完整共享词表。

这种选择只查看学生分布,没有用教师 top-k 做信息筛选。它的实际含义是:先围绕学生当前认为可能的局部动作建立监督支持,再问教师如何重新分配这些动作的概率。若学生 top-k 同时承载教师的大部分质量,就没有必要在每个位置比较十万量级的全部共享 token。

实验设计

三组异构模型

Teacher → StudentTeacher 类型Student 类型静态词表 Jaccard
Qwen2.5-7B-Instruct → Llama-3.2-3B-Instruct指令模型指令模型64.32%
Granite-4.1-8B → Phi-4-mini-instructGranite 基座指令模型39.49%
Granite-4.1-8B → Qwen2.5-7B-BaseGranite 基座基座模型64.87%

这三组覆盖四个模型系列,既包含 instruction-to-instruction,也包含向 base student 的迁移。Granite→Phi 的静态 Jaccard 只有 39.49%,是检验“大词表差异是否必然造成严重监督缺口”的关键反例。

数据、训练与评测

训练源池共有 20,000 个提示:10,000 个来自 DAPO-Math-17K,10,000 个来自 CodeForces;论文明确说明没有做去重。不同学生按各自 tokenizer 过滤到不超过 2,048 个 prompt token,因此实际保留数量会略有差异。

每次训练运行 100 个 on-policy iteration,每步由当前学生对抽样提示各生成一个响应,全局 batch size 为 512,最长生成 8,192 token。优化器为 AdamW,学习率 1 × 10^-6;rollout 使用 temperature 1.0、top-p 0.95。训练在单节点 8 张 NVIDIA H20 上以 FSDP2、bfloat16、gradient checkpointing 和 SGLang rollout engine 完成。

数学评测覆盖 MATH500、GSM8K、AIME 2024/2025/2026、AMC23 和 Minerva-Math,每题采样 32 个答案;代码覆盖 HumanEval、MBPP 和 LiveCodeBench,每题采样 8 个答案。Math 与 Code 分别是域内基准的算术平均,Full 再对两个域等权平均。主比较还包含 ULD、Extended ULD、GOLD 和 SimCT,统一使用 KDFlow 实现。

主要实验结果

1. 静态词表差异不等于动态对齐缺口

训练期间每步保存 512 个学生 rollout,共 51,200 个响应。尽管静态词表 Jaccard 只有 39.49% 至 64.87%,完整 100 步中的严格覆盖仍然很高:

Teacher → Student学生 token 严格覆盖教师 token 严格覆盖
Qwen → Llama93.56%85.91%
Granite → Phi96.98%97.26%
Granite → Qwen85.57%82.82%

最反直觉的是 Granite→Phi:它的静态词表重合最低,轨迹上的严格覆盖却最高。原因是自然生成 token 的频率极不均匀,常见文本片段可以在两个 tokenizer 中大量形成一对一边界;许多只存在于单侧词表的稀有项几乎不参与当前预测。

覆盖在训练过程中也相当稳定。论文比较第 1–20、41–60、81–100 步,单组模型的学生严格覆盖最大波动仅 1.43 个百分点,教师侧最大波动 3.75 个百分点。这说明结果不是某个初始 checkpoint 的偶然现象。

2. 共享词表承载近乎全部概率质量

作者另用蒸馏前学生在全部 20k 提示上各生成一次响应,测量 strict position 的原始 softmax 概率质量:

支持集合Qwen→Llama 学生/教师Granite→Phi 学生/教师Granite→Qwen 学生/教师
Student top-1694.55% / 93.92%94.68% / 93.54%98.44% / 97.67%
完整共享词表99.72% / 99.73%98.99% / 99.69%99.81% / 99.90%

非共享词表在严格位置上平均只承载约 0.1% 至 1.0% 的概率。更重要的是,虽然 top-16 完全由学生选出,它仍保留至少 93.54% 的教师质量;从 16 扩到 128,教师质量最多只再增加 3.44 个百分点,收益迅速递减。

这组测量解释了为什么 vocabulary size 或 Jaccard 不是好的监督充分性指标。真正相关的量不是“多少 token ID 能比较”,而是“在学生实际访问的 prefix 上,可比较支持承载多少概率”。

3. 覆盖达到 100%,准确率反而下降

λ = 0 只使用严格监督;任何正 λ 都补上全部 mismatch group。结果三组模型都在 λ = 0 达到最高 Full 平均分,18 个正权重设置全部比对应严格基线低 0.27 至 1.20 个百分点。

Teacher → Studentλ=0 Fullλ=0.25λ=0.75λ=1.5λ=1.5 降幅
Qwen → Llama32.8632.4732.4731.84-1.02
Granite → Phi42.4941.8842.0941.69-0.80
Granite → Qwen47.3547.0346.8246.55-0.80

附录的 benchmark-level 结果显示,下降不是只由 Full 聚合方式造成:每一组中,λ = 0 同时取得最高 Math 与 Code 域平均。结论应准确限定为“本文测试的 span log-probability MSE 不可靠”,而不是“所有 mismatch supervision 必然有害”;损失形式、归一化和组长差异都可能改变结果。

4. Top-16 保留大部分蒸馏收益

完整主表如下:

方法Qwen→Llama FullGranite→Phi FullGranite→Qwen Full
未蒸馏 Base26.9636.5529.56
ULD29.1238.6327.12
Extended ULD31.1338.3532.57
GOLD27.1641.7546.55
SimCT31.5941.6846.10
Strict full32.8642.4947.35
Strict top-1632.6442.2647.06
Strict top-12832.3842.5447.65

Top-16 并非每列绝对最高,但它相对 Base 保留了 Strict full 至少 96% 的 Full 增益,并在三组 Full 平均上都高于最强的四个替代基线 0.51 至 1.05 个百分点。Top-128 也没有稳定优于 top-16 或 full:它在 Granite→Phi、Granite→Qwen 最好,在 Qwen→Llama 则较低。这支持的是“很小的动态支持已足够”,而不是某个固定 k 对所有模型都最优。

三个 strict 版本在所有模型对上都同时提升 Base 的数学和代码域平均;反例则是 Granite→Qwen 上的 ULD,其代码迁移退化严重,Full 甚至低于 Base。跨 tokenizer 目标显然不仅要能计算,还要避免破坏学生已有能力。

5. 梯度诊断解释了 span 监督为什么可能有害

作者从 Strict full 训练的第 0、20、60、100 步 checkpoint 出发,用相同的 512 个提示重新生成响应,在不更新参数的情况下分别计算 strict gradient 和 span gradient。控制组把 strict position 随机分成两半,测量同一目标不同位置之间的 gradient cosine。

  • Qwen→Llama 与 Granite→Phi 的 mismatch–strict cosine 始终接近 0;Granite→Qwen 初始为 -0.360,之后逐渐接近 0。
  • 所有 checkpoint 上,mismatch–strict cosine 都低于 strict split-half 控制,说明弱一致不是普通 minibatch 噪声即可解释。
  • 从第 0 步到第 100 步,未加权的 span/strict gradient norm ratio 分别增长约 6.6、28.0 和 17.8 倍。
  • 第 100 步时,Qwen→Llama 的 span gradient norm 已达 strict 的 1.942 倍;另外两组虽仍较小,也从 0.008/0.015 增到 0.233/0.269。

因此固定 λ 的实际优化影响并不固定:训练后期 strict loss 变小,而方向弱相关的 span 分量相对变强。它可能逐渐从“补充信号”变成干扰主目标的梯度。这是一个有解释力的相关证据,但还不是严格因果证明;论文没有展示 gradient surgery、动态 λ 或基于置信度筛选是否能修复下降。

6. 附加实验扩大了适用范围

在 Qwen3-235B-A22B-Instruct-2507 → Granite-4.1-8B 的更大 teacher 设置中,Strict top-16 的 Math、Code、Full 分别达到 51.29、73.62、62.46,均高于 ULD、Extended ULD、GOLD 和 SimCT;最强对照 SimCT 的 Full 为 56.25。这个结果说明紧凑支持没有因为 teacher 规模扩大而失效。

在 ALFWorld 中,Qwen3-4B-Instruct-2507 蒸馏到 Llama-3.2-3B-Instruct。Strict top-16 的 seen/unseen success rate 为 26.04%/34.64%,总体 30.34%,高于 SimCT 的总体 28.52%,也超过未蒸馏学生的 10.68%;平均交互轮数 39.78 同样是被评估蒸馏方法中最低。这为数学和代码之外的交互式 agent 任务提供了支持,不过只有一个环境与一个模型对。

如何理解这篇论文

覆盖率是结构指标,不是学习质量指标

“每个位置都有 loss”只说明训练图连通,不说明 target 与学生当前决策有兼容的归纳偏置。Mismatch group 把不同数量的 autoregressive 决策压成一个路径概率标量:多个 token 的 log-probability 相加后再平方,既丢失内部步骤的分布形状,也可能让长度、低概率 token 和 calibration 误差被放大。100% 覆盖由此可能只是把更多不可区分的信号写进优化器。

动态概率质量比静态词表重合更接近真正资源需求

跨 tokenizer 方法经常把词表规模视为成本下界,但本文显示,在学生访问的 prefix 上,概率分布高度稀疏且师生集中区域相似。Student top-16 支持把每个严格位置的分布比较缩到很小,同时仍保留大部分教师质量。若实现能避免先计算和传输完整 teacher logits,这可能显著降低通信、显存和 loss 计算成本。

不过论文主要证明了统计与准确率充分性,没有报告端到端 wall-clock、峰值显存、跨节点带宽或 teacher serving 成本。Top-16 的系统加速仍取决于实现:如果必须先物化教师完整 softmax 才截取 16 项,理论支持缩小不会自动转化为同等比例的训练加速。

可靠监督可以是选择问题,而非对齐问题

本文与近年来 selective OPD 的方向相呼应:不是每个 teacher token 都同样有用,也不是覆盖越广越好。Student-selected support、teacher entropy、师生 disagreement、position importance 与梯度一致性都可以成为选择依据。跨 tokenizer 场景新增的约束是:只有部分位置和词表项能够直接比较,因此可靠性筛选应同时发生在位置、支持集合和目标函数三个层面。

局限与审慎解读

  • 主结论依赖一种 mismatch objective。 论文测试的是 span path log-probability MSE。它失败不能推出 SimCT 式多 token distribution、byte-prefix marginalization、learned mapping 或其他归一化目标都会失败。
  • 模型对仍然有限。 主实验只有三组、参数规模约 3B 至 8B;235B teacher 附加实验只测试 Strict top-16,没有重复完整 span 权重扫描与梯度诊断。
  • 任务集中在数学和代码。 主结论来自结构化推理与程序生成,只有一个 ALFWorld 附加设置。自然对话、翻译、多语言、长文本和开放式写作是否同样成立仍未知。
  • 训练数据没有去重。 作者从 DAPO-Math-17K 与 CodeForces 各采样 10k,并明确不做 deduplication;论文也没有报告与十个评测集之间的污染检查。
  • 每个设置看起来是单次训练。 论文对答案进行多次采样,却未给训练随机种子的均值、方差或置信区间。0.27 至 1.20 个百分点的差异需要训练级复现才能更稳健地解释。
  • Full 平均是人为聚合。 它先平均七个数学基准和三个代码基准,再让两域各占 50%。表中保留了分基准结果,但“至少 96% 增益”等总结依赖这个聚合定义。
  • Top-k 的效率收益未实测。 论文展示概率质量和下游分数,没有给通信量、吞吐、FLOPs、训练时间或显存对比;compact support 的工程价值仍需系统实验。
  • 梯度分析是诊断而非因果干预。 弱 cosine 与增长的 norm ratio 能解释性能下降,却没有通过动态重加权、投影冲突梯度或消融特定 mismatch 类型来证明哪一机制占主导。
  • 严格对齐仍会排除约 3% 至 17% 的 token。 这些位置平均少,不代表对罕见语言、特殊格式或关键推理步骤不重要;平均概率质量也可能掩盖尾部样本。
  • 基线实现细节并非完全同构。 四个替代方法虽然统一来自 KDFlow,但 EOS inclusion、位置对齐和 loss reduction 存在方法特定差异,比较反映完整训练方案而非单一公式替换。

应用影响

更低成本的跨家族模型蒸馏

企业经常希望用一个强 teacher 改善不同架构、不同 tokenizer 的开源 student。论文给出的最简可行基线很有吸引力:先只找严格一对一位置,再在学生 top-16 共享支持上做 reverse KL。它不需要训练额外词表映射、修改 student 输出头或引入 byte decoder,并在本文测试中优于更复杂基线。

生产实现应把它视为起点而非固定配方。可以在线监控四组信号:严格 token 覆盖、共享词表概率质量、top-k 中的 teacher mass、候选附加目标与 strict gradient 的 cosine/norm ratio。当语言、领域或训练阶段变化导致这些统计恶化时,再启用更复杂的对齐或自适应 k,比默认追求全覆盖更稳健。

蒸馏系统的评价应从“可计算”转向“有收益”

一个 cross-tokenizer loss 能在所有位置返回有限数值,不等于它提供正确学习方向。更完整的验收流程至少应包含:

  1. 在未蒸馏学生 rollout 上测动态覆盖与概率质量,而非只报 vocabulary Jaccard;
  2. 用固定严格目标做增量消融,验证新增位置是否提高真实下游任务;
  3. 观察附加分量的梯度方向与相对尺度是否随训练漂移;
  4. 分语言、token 类型、group 长度和罕见样本报告尾部,而不只看全局平均;
  5. 同时报告准确率与实际系统成本,确认 compact objective 是否带来吞吐或显存收益。

对 tokenizer 设计的启示

论文不意味着 tokenizer 差异无关,而是指出静态词表重合并不能单独预测蒸馏难度。即便 Jaccard 很低,常见轨迹仍可能高度严格对齐;反过来,高 overlap 也不能保证新增 span 信号可靠。选择 student 时,与其只比较 vocabulary 文件,更有价值的是先在目标域跑一批真实 student trajectory,测量位置覆盖、共享质量与关键尾部。

相关工作

第一类是 On-Policy Distillation。MiniLLM 以 reverse KL 抑制学生在教师低概率区域投入过多质量,GKD 支持多种 divergence 与 on-policy/off-policy 混合。后续工作开始研究 teacher signal 的选择:局部 top-k、teacher entropy、student entropy、师生 disagreement 以及兼容性。本文把“集中支持仍足够”的观察扩展到 tokenizer 异构且位置并不完全可比的情形。

第二类是 跨 tokenizer 分布匹配。ULD 对排序概率做 identity-free matching;DSKD、CDM 和 DWA-KD 学习双空间表示或词表关系;likelihood matching 和 span representation 让不同 tokenization 在更大文本单元上比较;Byte-Level Distillation 增加字节级预测头。这些方法解决“如何构造可比较量”,本文则追问这些量进入优化后是否真的有净收益。

第三类是 跨 tokenizer 的 on-policy 对齐恢复。GOLD 合并文本等价 token group,SimCT 将最小多 token 单元加入共享监督空间,Byte-Prefix Marginalization 将教师概率沿字节前缀映射到学生 token,并发现空白位置监督可能导致训练崩溃。本文与它们的差别不是提出覆盖更广的接口,而是用 span-MSE 负结果、概率质量与梯度诊断证明:覆盖本身不足以作为设计目标。

第四类是 多任务优化中的梯度冲突。论文借用 gradient cosine 与 norm ratio 分析两个 loss 分量的相互作用,思想上接近 gradient surgery:当目标方向接近正交或相反,简单固定加权可能让某个任务压制另一个。本文没有实施冲突修复,但为后续的动态权重、投影或可信度门控提供了直接测量依据。

总结

这篇论文最重要的贡献不是一个更复杂的跨 tokenizer 对齐算法,而是一套更好的提问顺序。先看学生真实生成轨迹上有多少位置严格可比,再看可比词表承载多少概率,最后才判断扩大覆盖是否改善下游学习。三组主实验给出的答案很一致:严格位置比静态 Jaccard 暗示的多,共享支持比词表计数暗示的完整,top-16 比想象中充分,而强行补齐 mismatch group 的 span MSE 比想象中危险。

它也给出了一条可检验的解释链:正权重 span 监督在 18 个设置中全部降低 Full 准确率;相应梯度与 strict 方向弱一致或冲突;其相对 norm 又随训练增长。这个链条仍需更多模型、任务、随机种子和替代 span objective 验证,但已经足以推翻“覆盖率天然是越高越好”的默认假设。

对工程团队而言,最实用的结论是从简单可靠的 strict top-k 基线出发,用动态轨迹统计决定是否增加复杂性。跨 tokenizer 蒸馏真正稀缺的资源不是可构造 loss 的位置数量,而是能够稳定改善学生的监督信号。

参考资料

  1. Hugging Face Daily Papers:Rethinking Cross-Tokenizer On-Policy Distillation
  2. arXiv:Rethinking Cross-Tokenizer On-Policy Distillation
  3. arXiv HTML 全文
  4. arXiv PDF 全文
  5. 匿名代码仓库:Cross-Tokenizer-OPD
  6. CodeForces 训练数据集
  7. Granite 4.1 模型说明