LLM-as-a-Coach:核心发现与实验结果
重建 EL 与 rubric-based RL 在两类 policy、两类 feedback model 和五个评测集上的主结果,分析逐项增益、teacher context 消融、迭代 teacher 的遗忘现象及反馈量化 toy experiment。
1. 主结果:多数评测上 EL 优于 RL
论文按 policy 与 feedback model 的组合报告结果。下表完整转录主表数值,并加入 EL 相对 RL 的差值;不同 benchmark 的量纲不同,差值不可跨列直接相加。
| Policy + Feedback | 方法 | WildChat | AlpacaEval v2 | WildBench | ArenaHard v2 | CW-v3 |
|---|---|---|---|---|---|---|
| Qwen3-8B + Qwen3-8B | Base | 78.1 | 34.5 | 17.6 | 29.1 | 73.8 |
| RL | 79.2 | 37.3 | 18.4 | 30.5 | 74.3 | |
| EL | 80.0 | 40.0 | 21.8 | 31.0 | 76.0 | |
| EL − RL | +0.8 | +2.7 | +3.4 | +0.5 | +1.7 | |
| Qwen3-8B + GPT-4o | RL | 80.4 | 38.2 | 19.2 | 31.2 | 74.4 |
| EL | 80.7 | 37.4 | 22.0 | 31.9 | 75.3 | |
| EL − RL | +0.3 | −0.8 | +2.8 | +0.7 | +0.9 | |
| OLMo-3-7B + OLMo-3-7B | Base | 75.7 | 43.6 | 39.0 | 21.8 | 78.7 |
| RL | 76.0 | 45.9 | 42.1 | 23.3 | 78.8 | |
| EL | 77.1 | 50.8 | 47.5 | 26.2 | 78.8 | |
| EL − RL | +1.1 | +4.9 | +5.4 | +2.9 | 0.0 | |
| OLMo-3-7B + GPT-4o | RL | 76.8 | 44.7 | 40.3 | 22.5 | 77.8 |
| EL | 78.2 | 48.5 | 46.2 | 25.1 | 78.0 | |
| EL − RL | +1.4 | +3.8 | +5.9 | +2.6 | +0.2 |
如何概括而不过度宣传
- 4 个模型组合 × 5 个评测集 = 20 个 EL/RL 比较;EL 为 18 胜、1 平、1 负。
- 唯一明确下降是 Qwen3-8B + GPT-4o 在 AlpacaEval v2 上低 0.8 个百分点。
- 平局是 OLMo self-feedback 在 CreativeWritingV3 上都为 78.8。
- OLMo 上的跨分布增益普遍大于 Qwen,说明收益可能依赖 policy family,而不是一个固定 effect size。
- 论文没有给置信区间、显著性检验或多 seed 标准差,所以“小幅胜出”不应自动解释为统计上可靠。
论文报告的是 top-3 performing checkpoints 的平均值,而不是最后 checkpoint。正文没有充分说明 top-3 的选择集与选择指标;这会影响对结果稳健性的判断。
2. 关键发现一:收益主要出现在 unseen benchmark
作者额外从 WildChat training data 抽取 1,000 条样本,在训练完成后比较 train、held-out 与 unseen benchmark 的提升。现象是:
- RL 在训练子集上的增益更大;
- EL 在 WildChat held-out、AlpacaEval v2 与 WildBench 上更好;
- 换用 GPT-4o 作为反馈模型时出现类似趋势。
作者将它解释为:scalar reward 更容易被 policy 找到只对训练评分有效的捷径,而 experience-induced distributional guidance 更倾向于可迁移行为。
这支持“EL generalizes better”的方向性判断,但还不是 reward hacking 的直接测量。没有展示被 exploit 的具体模式、adversarial prompts、reward-vs-human gap 或训练中 reward 与真实质量的分叉轨迹。
3. 关键发现二:不是“文本越多越好”
Teacher context 消融在 Qwen3-1.7B policy + Qwen3-4B coach 上完成:
| Context 配置 | WildChat score | IFEval OOD accuracy | 相对 Base 的解释 |
|---|---|---|---|
| Base Model | 64.8 | 68.0 | 未训练基线 |
| RL | 67.7 | 67.6 | 任务分数升,OOD 轻微降 |
| Full Critique | 67.9 | 64.6 | teacher 被评价语气带偏,OOD 明显降 |
| Rubrics Only | 68.1 | 65.6 | 有目标但无 response-specific feedback |
| Multiple-Choice | 66.3 | 68.5 | OOD 保持,任务增益有限 |
| Default EL | 68.6 | 68.8 | 两项都最好 |
Default EL 相对 RL 的 WildChat 提升为 +0.9,IFEval 提升为 +1.2。最重要的信息不是绝对分数,而是:
- 完整 critique 包含更多 token,却比提炼经验差;
- rubrics 本身不能替代针对当前 response 的反馈;
- 把反馈压成 10 类 directive 保持了 OOD,却损失 task improvement;
- context 的语义角色和可迁移性比纯长度更重要。
作者还报告,把 policy response 与完整评分输出一起放进 context 会在数个 training steps 内发散。这是一个重要负结果,但论文没有进一步定位发散来自 context leakage、copying attractor、KL 数值问题还是 teacher/student support mismatch。
4. 关键发现三:iterative teacher 提升目标任务,却带来遗忘
该消融使用 Qwen3-8B self-coaching:
| 配置 | WildChat score | IFEval OOD accuracy |
|---|---|---|
| Base Model | 78.1 | 83.5 |
| RL | 79.2 | 81.3 |
| Fixed Teacher | 80.0 | 83.1 |
| Iterative | 80.7 | 74.9 |
| Iterative + General | 80.7 | 79.9 |
解读:
- Fixed Teacher 几乎保持 base 的 IFEval(−0.4),同时把 WildChat 提高 1.9;
- Iterative Teacher 再提高 WildChat 0.7,却使 IFEval 相对 fixed teacher 下降 8.2;
- 加入 25% 比例的 Tulu3 general prompts,把 IFEval 恢复 5.0,但仍低于 base 3.6;
- “teacher 随 student 一起进步”不是免费增益,它会放大 specialization 与 forgetting。
这也是论文里最有工程价值的结果之一:如果把 EL 做成持续迭代系统,就必须显式维护 general-capability anchor,而不是只追踪目标域指标。
5. 关键发现四:高分区间仍能保留细粒度偏好
论文认为 scalar reward 的问题在接近满分时最明显。许多质量不错但风格、事实密度和组织方式不同的回答都可能得到 10 分;RL objective 无法区分同 reward response。EL 让经验改变 teacher 的整段 token distribution,因此即便两个样本最终 score 相同,仍可能得到不同的局部学习方向。
这个机制上的差异可以概括为:
flowchart TD
A["多个高质量 responses"] --> B["Judge 都给 10 分"]
B --> C["RL 看到相同 reward"]
A --> D["Coach 提炼不同 strengths 与 weaknesses"]
D --> E["条件 teacher 保留不同 token preferences"]
但主实验没有直接报告“同分 responses 内的 preference preservation”指标;这一点主要由方法结构和 toy analysis 支持。
6. Controlled toy experiment 告诉了什么
作者构造一个 的 categorical policy,目标是拟合理想分布 :
- binary target:用 2 级 reward;
- bimodal Gaussian-mixture target:把 量化为 5 级 reward;
- RL 用 REINFORCE + toward-uniform KL;
- distributional guidance 直接最小化 。
结果是:binary case 中两者都能恢复目标;五级 reward 下,RL 学到阶梯状分布,同 reward plateau 内的 token 概率相同,而 direct KL 保留平滑双峰形状。
这个实验正确展示了量化会丢失 level 内部差异。不过它只是反馈表示的示意:distributional baseline 被直接给予 ,真实 EL 只能通过 noisy natural-language experience 间接诱导 teacher distribution。作者也明确说,这不是对全部 scalar-reward 方法基本局限的证明,也不是完整 EL/RL pipeline 的忠实模拟。
7. 实际效应与统计证据
论文的绝对提升通常在 0–6 分/百分点之间,且 benchmark 定义不同。最稳定的信号来自:
- 四种组合的 WildBench 全部提升,范围 +2.8 到 +5.9;
- 四种组合的 WildChat 全部提升,范围 +0.3 到 +1.4;
- OLMo 的 AlpacaEval 与 ArenaHard 提升较明显;
- Qwen + GPT-4o 在 AlpacaEval 出现反例。
缺失的信息包括:
- prompt-level bootstrap confidence interval;
- 不同训练 random seed 的 variance;
- checkpoint selection 的不确定性;
- judge variance 与 human agreement;
- 多重 benchmark 比较校正。
所以“consistently outperforms”可以作为描述性结论,但不能从当前表格推导出严格统计显著性。