热心市民王先生

LLM-as-a-Coach:核心发现与实验结果

#技术研究 #实验结果 #大模型评测

重建 EL 与 rubric-based RL 在两类 policy、两类 feedback model 和五个评测集上的主结果,分析逐项增益、teacher context 消融、迭代 teacher 的遗忘现象及反馈量化 toy experiment。

1. 主结果:多数评测上 EL 优于 RL

论文按 policy 与 feedback model 的组合报告结果。下表完整转录主表数值,并加入 EL 相对 RL 的差值;不同 benchmark 的量纲不同,差值不可跨列直接相加。

Policy + Feedback方法WildChatAlpacaEval v2WildBenchArenaHard v2CW-v3
Qwen3-8B + Qwen3-8BBase78.134.517.629.173.8
RL79.237.318.430.574.3
EL80.040.021.831.076.0
EL − RL+0.8+2.7+3.4+0.5+1.7
Qwen3-8B + GPT-4oRL80.438.219.231.274.4
EL80.737.422.031.975.3
EL − RL+0.3−0.8+2.8+0.7+0.9
OLMo-3-7B + OLMo-3-7BBase75.743.639.021.878.7
RL76.045.942.123.378.8
EL77.150.847.526.278.8
EL − RL+1.1+4.9+5.4+2.90.0
OLMo-3-7B + GPT-4oRL76.844.740.322.577.8
EL78.248.546.225.178.0
EL − RL+1.4+3.8+5.9+2.6+0.2

如何概括而不过度宣传

  • 4 个模型组合 × 5 个评测集 = 20 个 EL/RL 比较;EL 为 18 胜、1 平、1 负
  • 唯一明确下降是 Qwen3-8B + GPT-4o 在 AlpacaEval v2 上低 0.8 个百分点。
  • 平局是 OLMo self-feedback 在 CreativeWritingV3 上都为 78.8。
  • OLMo 上的跨分布增益普遍大于 Qwen,说明收益可能依赖 policy family,而不是一个固定 effect size。
  • 论文没有给置信区间、显著性检验或多 seed 标准差,所以“小幅胜出”不应自动解释为统计上可靠。

论文报告的是 top-3 performing checkpoints 的平均值,而不是最后 checkpoint。正文没有充分说明 top-3 的选择集与选择指标;这会影响对结果稳健性的判断。

2. 关键发现一:收益主要出现在 unseen benchmark

作者额外从 WildChat training data 抽取 1,000 条样本,在训练完成后比较 train、held-out 与 unseen benchmark 的提升。现象是:

  • RL 在训练子集上的增益更大;
  • EL 在 WildChat held-out、AlpacaEval v2 与 WildBench 上更好;
  • 换用 GPT-4o 作为反馈模型时出现类似趋势。

作者将它解释为:scalar reward 更容易被 policy 找到只对训练评分有效的捷径,而 experience-induced distributional guidance 更倾向于可迁移行为。

这支持“EL generalizes better”的方向性判断,但还不是 reward hacking 的直接测量。没有展示被 exploit 的具体模式、adversarial prompts、reward-vs-human gap 或训练中 reward 与真实质量的分叉轨迹。

3. 关键发现二:不是“文本越多越好”

Teacher context 消融在 Qwen3-1.7B policy + Qwen3-4B coach 上完成:

Context 配置WildChat scoreIFEval OOD accuracy相对 Base 的解释
Base Model64.868.0未训练基线
RL67.767.6任务分数升,OOD 轻微降
Full Critique67.964.6teacher 被评价语气带偏,OOD 明显降
Rubrics Only68.165.6有目标但无 response-specific feedback
Multiple-Choice66.368.5OOD 保持,任务增益有限
Default EL68.668.8两项都最好

Default EL 相对 RL 的 WildChat 提升为 +0.9,IFEval 提升为 +1.2。最重要的信息不是绝对分数,而是:

  1. 完整 critique 包含更多 token,却比提炼经验差;
  2. rubrics 本身不能替代针对当前 response 的反馈;
  3. 把反馈压成 10 类 directive 保持了 OOD,却损失 task improvement;
  4. context 的语义角色和可迁移性比纯长度更重要。

作者还报告,把 policy response 与完整评分输出一起放进 context 会在数个 training steps 内发散。这是一个重要负结果,但论文没有进一步定位发散来自 context leakage、copying attractor、KL 数值问题还是 teacher/student support mismatch。

4. 关键发现三:iterative teacher 提升目标任务,却带来遗忘

该消融使用 Qwen3-8B self-coaching:

配置WildChat scoreIFEval OOD accuracy
Base Model78.183.5
RL79.281.3
Fixed Teacher80.083.1
Iterative80.774.9
Iterative + General80.779.9

解读:

  • Fixed Teacher 几乎保持 base 的 IFEval(−0.4),同时把 WildChat 提高 1.9;
  • Iterative Teacher 再提高 WildChat 0.7,却使 IFEval 相对 fixed teacher 下降 8.2;
  • 加入 25% 比例的 Tulu3 general prompts,把 IFEval 恢复 5.0,但仍低于 base 3.6;
  • “teacher 随 student 一起进步”不是免费增益,它会放大 specialization 与 forgetting。

这也是论文里最有工程价值的结果之一:如果把 EL 做成持续迭代系统,就必须显式维护 general-capability anchor,而不是只追踪目标域指标。

5. 关键发现四:高分区间仍能保留细粒度偏好

论文认为 scalar reward 的问题在接近满分时最明显。许多质量不错但风格、事实密度和组织方式不同的回答都可能得到 10 分;RL objective 无法区分同 reward response。EL 让经验改变 teacher 的整段 token distribution,因此即便两个样本最终 score 相同,仍可能得到不同的局部学习方向。

这个机制上的差异可以概括为:

flowchart TD
    A["多个高质量 responses"] --> B["Judge 都给 10 分"]
    B --> C["RL 看到相同 reward"]
    A --> D["Coach 提炼不同 strengths 与 weaknesses"]
    D --> E["条件 teacher 保留不同 token preferences"]

但主实验没有直接报告“同分 responses 内的 preference preservation”指标;这一点主要由方法结构和 toy analysis 支持。

6. Controlled toy experiment 告诉了什么

作者构造一个 V=200V=200 的 categorical policy,目标是拟合理想分布 pp^*

  • binary target:用 2 级 reward;
  • bimodal Gaussian-mixture target:把 pp^* 量化为 5 级 reward;
  • RL 用 REINFORCE + toward-uniform KL;
  • distributional guidance 直接最小化 DKL(πθp)D_{KL}(\pi_\theta\|p^*)

结果是:binary case 中两者都能恢复目标;五级 reward 下,RL 学到阶梯状分布,同 reward plateau 内的 token 概率相同,而 direct KL 保留平滑双峰形状。

这个实验正确展示了量化会丢失 level 内部差异。不过它只是反馈表示的示意:distributional baseline 被直接给予 pp^*,真实 EL 只能通过 noisy natural-language experience 间接诱导 teacher distribution。作者也明确说,这不是对全部 scalar-reward 方法基本局限的证明,也不是完整 EL/RL pipeline 的忠实模拟。

7. 实际效应与统计证据

论文的绝对提升通常在 0–6 分/百分点之间,且 benchmark 定义不同。最稳定的信号来自:

  • 四种组合的 WildBench 全部提升,范围 +2.8 到 +5.9;
  • 四种组合的 WildChat 全部提升,范围 +0.3 到 +1.4;
  • OLMo 的 AlpacaEval 与 ArenaHard 提升较明显;
  • Qwen + GPT-4o 在 AlpacaEval 出现反例。

缺失的信息包括:

  • prompt-level bootstrap confidence interval;
  • 不同训练 random seed 的 variance;
  • checkpoint selection 的不确定性;
  • judge variance 与 human agreement;
  • 多重 benchmark 比较校正。

所以“consistently outperforms”可以作为描述性结论,但不能从当前表格推导出严格统计显著性。

参考资料