RLSVR / SpyRL
基于 Hugging Face Daily Papers 2026-08-03 榜首论文,深入解读 RLSVR 与 SpyRL 如何借助信息不对称多智能体自博弈,把开放式生成质量转化为可规则验证的间谍识别信号,并审视其在摘要、创意写作、数学推理上的收益、代理目标偏差与扩展边界。
自动研究时间:2026-08-04 09:02(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Aug 3,列表最顶部为 From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement;详情页标注#1 Paper of the day。
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> arXiv 31 页 PDF 与完整 TeX 源码(含附录、实验表和训练配置)-> 官方代码仓库交叉核对。
执行摘要
RLVR(Reinforcement Learning with Verifiable Rewards)之所以能在数学和代码上规模化,是因为答案检查器、编译器或单元测试可以给出廉价、确定、几乎无限的奖励。但摘要、创意写作等开放式任务没有唯一正确答案:使用人工偏好、奖励模型或 LLM-as-a-Judge,都会重新引入标注成本、评审偏差、能力上限与逐次推理费用。
论文提出 RLSVR(Reinforcement Learning with Self-Verifiable Rewards):不直接拟合难以观测的“真实质量”,而是像自监督学习构造 pretext task 一样,把原任务变换成一个由环境预先注入隐藏变量、因此可以按规则核验结果的代理环境。其具体实现 SpyRL(Self-PlaY Reinforcement Learning) 借鉴“谁是卧底”:五名玩家中四名 civilian 看到完整材料,一名 spy 只看到被遮蔽的材料;所有玩家完成相同任务,再根据公开输出投票找出 spy。spy 身份由环境预先指定,检测是否正确可精确核验;每个输出收到的怀疑票数则反向成为 performer 的相对奖励。
结果很强:在 Qwen3-4B 与 Qwen3-8B 上,SpyRL 在五个摘要基准的 ROUGE-L、两个创意写作基准的成对偏好,以及七个数学与通用推理基准上均优于论文复现的 R-Zero 和 Absolute Zero。以 Qwen3-4B 为例,Math500 从 68.2 提升至 79.5,AIME 2025 从 6.7 提升至 20.0;盲测人评中,SpyRL 在 WritingPrompts 上相对基础模型、R-Zero、Absolute Zero 的总体胜率分别为 80.0%、78.5% 和 74.0%。消融实验还显示,两阶段交替优化、信息不对称和角色优势校准缺一不可。
不过,“自验证”需要精确定义:被严格验证的是预设身份与投票是否一致,不是开放式作品的质量本身。 论文用怀疑票与 GPT-4o 排名的相关性、10 名博士生的 400 条盲评、替代评审模型及多基准结果证明代理信号具有经验有效性,但没有证明二者等价。共适应的 detector 仍可能学习表面捷径,performer 也可能优化“看起来不像 spy”而非用户真正重视的质量。RLSVR 最重要的价值因此不是彻底解决开放式奖励,而是给出一种新设计空间:通过环境构造,把一部分不可直接验证的能力变成可规模化训练的代理博弈。
1. 论文基本信息
| 项目 | 内容 |
|---|---|
| 论文标题 | From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement |
| 论文编号 | arXiv:2607.23802 |
| arXiv 版本 | v1 于 2026-07-26 提交;v2 于 2026-07-31 更新 |
| 发表状态 | COLM 2026 conference paper |
| Hugging Face 状态 | 2026-08-03 Daily Papers 榜首,#1 Paper of the day |
| 作者 | Qinsi Wang、Jing Shi、Huazheng Wang、Kun Wan、Yiran Wu、Bo Liu、Qingyun Wu、Hai Helen Li、Yiran Chen、Handong Zhao、Wentian Zhao |
| 机构 | Duke University、Adobe、Oregon State University、Pennsylvania State University、National University of Singapore、Amazon |
| 研究对象 | 开放式任务强化学习、自验证奖励、多智能体自博弈、模型自提升 |
| 主要模型 | Qwen3-4B、Qwen3-8B |
| 主要任务 | 文本摘要、创意写作、数学与通用推理 |
核心链接:
- Hugging Face 详情页:https://huggingface.co/papers/2607.23802
- arXiv 摘要页:https://arxiv.org/abs/2607.23802
- arXiv PDF:https://arxiv.org/pdf/2607.23802
- arXiv HTML 全文:https://arxiv.org/html/2607.23802v2
- 官方代码与模型:https://github.com/wangqinsi1/RLSVR/tree/SpyRL
2. 背景与动机:开放式 RL 的验证瓶颈
2.1 RLVR 为什么依赖“已知正确答案”
设输入为 (x),指令为 (\tau),策略 (\pi_\theta) 生成输出 (y)。经典 RLVR 优化的是确定验证器 (V(x,y)\in{0,1}) 的期望:
[ \max_\theta ; \mathbb{E}_{x,y}[V(x,y)] ]
数学答案检查、代码测试或形式证明都能提供这种信号。它不要求每条轨迹由人打分,也不会因为 judge 模型换一种表达偏好而漂移。
开放式任务真正想优化的却是潜在质量函数 (Q(x,y)):摘要要兼顾事实、覆盖与压缩,故事要兼顾新颖、情感、连贯与一致,但这些维度没有唯一标签。用学习到的 (\hat V) 近似 (Q) 虽然可行,却带来三个瓶颈:
- evaluator 的偏见会进入策略梯度;
- actor 很难稳定超过 evaluator 的能力边界;
- 每次 rollout 都要额外调用 reward model 或外部 API。
2.2 RLSVR 的转向:不逼近缺失标签,而是重写任务
RLSVR 借鉴自监督学习。Masked language modeling 并没有先为“语言理解”造一个人工总分,而是从数据自身构造可恢复 token 这一代理目标。类似地,RLSVR 用任务变换 (\Phi) 把原任务映射成代理环境 (\mathcal E):
- 环境采样输入 (x) 和隐藏变量 (z),并把 (z) 保存为本局 ground truth;
- 根据 ((x,z)) 构造不同 observation,玩家仍执行原目标任务;
- 环境要求玩家仅根据公开输出推断关于 (z) 的问题;
- 将推断结果与环境记录的 (z) 比较,得到规则奖励。
关键约束不是“任何游戏都可以”,而是代理交互必须与目标能力高度重叠。若识别 (z) 只依赖固定水印、长度或格式,模型学到的就是捷径;只有当识别隐藏条件必须依赖摘要完整性、故事契合度或推理严谨性时,奖励才有机会迁移回目标任务。
3. 核心贡献
3.1 RLSVR:把 verifiability 视为可设计的环境属性
论文最有启发性的主张是:可验证性不一定是任务天生具备的属性,也可能通过环境变换构造出来。隐藏变量由环境自己生成,因此 ground truth 不依赖外部标注;RL 优化器仍能使用 GRPO 等成熟的 RLVR 机制。
3.2 SpyRL:用信息不对称将质量差异外显
SpyRL 将 RLSVR 实例化为社会推理游戏。civilian 与 spy 做同一任务,但信息量不同。设计目标是让信息缺失最终表现为可被同行察觉的输出缺陷,同时尽量保持输入主题、长度与表面风格一致,降低 detector 走捷径的机会。
3.3 performer 与 detector 的闭环共同进化
detector 的正确票由预设身份直接验证;其投票分布又定义 performer 奖励。performer 变强后,旧 detector 会变得迟钝;detector 变强后,performer 必须生成更完整、更可信的输出才能少收怀疑票。论文用带滞回阈值的阶段切换保持这一动态课程,而不是同时更新两个快速移动的目标。
3.4 跨开放式与可验证任务的系统实验
论文不只在摘要和创意写作上验证代理奖励,还覆盖数学、MMLU-Pro、GPQA-Diamond、科学摘要、跨任务迁移、更难推理基准、人评、替代 LLM judge、rubric-as-reward 对比和多项消融。这使贡献不止停留在一个有趣游戏示例。
4. 方法详解
4.1 Performing Stage:同一任务,不同信息
每局从 (n) 个玩家中均匀选出 spy 索引 (u)。civilian 获得完整输入 (x),spy 获得退化输入 (g(x)):
[ o_i = \begin{cases} x, & i\neq u \ g(x), & i=u \end{cases} \qquad y_i\sim\pi^P_\theta(\cdot\mid o_i,\tau) ]
三个训练环境分别为:
| 任务 | 训练语料 | spy 的信息退化 | 玩家输出 |
|---|---|---|---|
| 文本摘要 | GovReport | 连续遮蔽 20% 输入 | 覆盖论点、发现与证据的摘要 |
| 创意写作 | WritingPrompts | 连续遮蔽 20% prompt | 基于同一主题的故事 |
| 数学推理 | Nemotron-CC-Math-v1 | 连续遮蔽 40% 原文 | 构造相关数学问题并给出严格解答 |
4.2 Detection Stage:真正可精确核验的部分
所有输出 (Y={y_1,\ldots,y_n}) 公开后,每个 detector 依据自己的 observation 和整组输出投票 (v_i)。检测奖励为:
[ r_i^D=\mathbb{I}[v_i=u] ]
这里没有 reward model:投票是否命中预先记录的 spy 索引可以直接判断。论文再在同一组内对检测奖励做 GRPO 式标准化,得到 group-relative advantage,避免单个 detector 的误判主导整轮更新。
4.3 Performing Reward:把怀疑票变成零和竞争
设 (m_u) 为 spy 收到的票数,(m_{c_j}) 为第 (j) 个 civilian 收到的票数,(\bar m_c) 为 civilian 平均票数。spy 收票越多,奖励越低;civilian 若比同伴更可疑,也会被惩罚:
[ r_u^P=-\beta(m_u-\bar m_c) ]
[ r_{c_j}^P=\frac{\beta}{n_c}(m_u-\bar m_c)-\lambda(m_{c_j}-\bar m_c) ]
这组奖励总和为零,促使双方持续竞争。它避免直接要求一个模型给故事打“82 分”,但也揭示了本文最重要的边界:performer 得到的是 detector 票数产生的代理奖励,而不是开放式质量的确定真值。
4.4 Role-Advantage Estimation:别把信息劣势误当能力差
spy 天生比 civilian 少信息,两个角色的原始奖励分布不可直接比较。SpyRL 为两种角色分别维护指数移动平均 baseline:
[ A_u^P=r_u^P-b_u,\qquad A_{c_j}^P=r_{c_j}^P-b_c ]
梯度衡量的是“玩家相对同角色通常水平表现如何”,不是“spy 是否比 civilian 差”。消融中,移除 RAE 后七个推理基准平均分从 50.4 降至 37.5,甚至低于基础模型的 41.4,说明角色校准不是次要技巧,而是阻止错误 credit assignment 的核心组件。
4.5 动态交替优化
训练并不在每轮同时更新 performer 与 detector。系统监控平滑后的识别准确率与 N/A 率:识别准确率达到 0.9 且弃权率低于 0.1 时,转去强化 performer;识别错误率达到 0.4 或弃权率达到 0.5 时,转去强化 detector;每阶段至少停留 5 次更新。
论文采用 GRPO、学习率 (10^{-6})、有效 batch size 1024、100 次训练迭代、五名玩家和单轮游戏。附录配置以 Qwen3-4B-Instruct-2507 为基础,在单节点 8 GPU 上使用 vLLM、FSDP、gradient checkpointing 与 reference model CPU offload。这里存在一个可复现性细节差异:主文写最大生成长度 2048 token,附录表与启动配置写最大响应长度 4096 token,复现实验时需要以发布代码或作者说明为准。
5. 实验设计
5.1 模型、基线与评测
主实验覆盖 Qwen3-4B 和 Qwen3-8B,并对比:
- R-Zero:proposer-solver 自演化框架;
- Absolute Zero:零数据 reinforced self-play reasoning;论文使用相同 Qwen3 骨干在数学域自行复现,而不是直接使用原论文发布的代码模型;
- Rubric-as-Reward(RaR):分别用 Qwen3.5-27B 与 GPT-4o 执行 rubric,作为依赖外部 evaluator 的对照。
摘要报告 ROUGE-L 与 GPT-4o 成对 A/B;创意写作按 novelty、emotion、coherence、consistency、overall 五维评审;推理任务报告准确率。每个 A/B 样本交换候选顺序评两次:一胜一负记为 tie,以减轻 position bias。
开放式自动评测仍可能继承 GPT-4o 偏好,因此论文增加了两层核对:10 名博士生对 400 个匿名写作样本做盲评;再用 Gemini-3.5-Flash 重做摘要与写作 A/B。这里的 LLM judge 只用于论文评估,不用于 SpyRL 的训练奖励。
5.2 主基准
| 能力 | 基准 |
|---|---|
| 摘要 | GovReport、Multi-News、QMSum、VCSum、SAMSum |
| 创意写作 | WritingPrompts、WritingBench |
| 数学与通用推理 | GSM8K、Math500、AIME 2024、AIME 2025、Minerva、MMLU-Pro、GPQA-Diamond |
| 更难推理 | AMC、Olympiad-Bench、SuperGPQA |
| 领域摘要 | arXiv、PubMed、BillSum;另用 PubMed 语料训练 SpyRL |
6. 实验结果
6.1 摘要:自动指标和成对偏好同时提升
| 骨干 | 方法 | GovReport | Multi-News | QMSum | VCSum | SAMSum |
|---|---|---|---|---|---|---|
| Qwen3-4B | Base | 30.2 | 23.1 | 21.3 | 15.1 | 43.2 |
| Qwen3-4B | Absolute Zero | 33.2 | 25.2 | 22.7 | 18.3 | 46.1 |
| Qwen3-4B | SpyRL | 36.7 | 26.4 | 25.3 | 19.1 | 48.2 |
| Qwen3-8B | Base | 29.0 | 23.1 | 19.2 | 14.9 | 44.3 |
| Qwen3-8B | Absolute Zero | 32.5 | 23.2 | 19.1 | 15.8 | 46.2 |
| Qwen3-8B | SpyRL | 34.1 | 25.8 | 23.2 | 19.1 | 48.5 |
表中为 ROUGE-L。相对各自未训练骨干,SpyRL 的 GPT-4o 平均胜率为 73.9%(4B)和 75.4%(8B);R-Zero 分别只有 51.9% 和 51.5%,Absolute Zero 为 61.5% 和 59.0%。在 PubMed 上重新训练后,SpyRL 在 arXiv、PubMed、BillSum 的 ROUGE-L 平均从 33.2 提升至 38.1,A/B 平均胜率为 70.2%,说明收益并非只适用于政府报告分布。
6.2 创意写作:改善不只体现在流畅度
Qwen3-4B SpyRL 相对未训练骨干,在 WritingPrompts 和 WritingBench 的 overall 胜率分别为 81.3% 与 75.1%;Qwen3-8B 对应为 76.5% 与 78.1%。与 R-Zero 和 Absolute Zero 直接比较时,SpyRL 在两套基准、五个维度的所有格子都超过 50%,优势尤其集中于 novelty 与 emotion。
人评给出一致方向:在 WritingPrompts 上,SpyRL 相对 Qwen3-4B、R-Zero、Absolute Zero 的 overall 胜率为 80.0%、78.5%、74.0%;WritingBench 上为 85.0%、80.5%、72.0%。GPT-4o 对人类“SpyRL 获胜”标签的 precision 为 85.7%–91.0%,recall 为 79.4%–93.8%,但这仍是有限样本上的一致性,而非自动评审无偏的证明。
与外部 rubric 的比较更细腻:SpyRL 对 Qwen3.5-27B-RaR 的 overall 胜率为 59.3% 和 56.2%,但对更强的 GPT-4o-RaR 只有 48.9% 和 48.2%,未在总体质量上胜出,只在 novelty 与 emotion 略占优势。论文估算两种 RaR 额外 evaluator 成本约为 200 美元和 900 美元;SpyRL 无外部 verifier API 成本,但多玩家 rollout 自身的算力成本并不是零。
6.3 推理:代理博弈也能增强已有验证器的任务
| 方法 | GSM8K | Math500 | AIME 24 | AIME 25 | Minerva | MMLU-Pro | GPQA-D |
|---|---|---|---|---|---|---|---|
| Qwen3-4B | 84.5 | 68.2 | 10.3 | 6.7 | 42.3 | 51.6 | 26.3 |
| + Absolute Zero | 89.3 | 76.2 | 12.2 | 13.4 | 41.9 | 52.6 | 35.3 |
| + SpyRL | 93.4 | 79.5 | 13.3 | 20.0 | 47.8 | 57.4 | 41.3 |
| Qwen3-8B | 91.8 | 74.2 | 15.3 | 12.1 | 49.3 | 58.1 | 33.3 |
| + Absolute Zero | 92.0 | 76.6 | 18.4 | 18.2 | 52.9 | 62.5 | 36.8 |
| + SpyRL | 93.5 | 81.2 | 20.0 | 23.3 | 56.3 | 63.1 | 39.8 |
除 Qwen3-8B 的 GPQA-Diamond 略低于 SpyRL 4B 的相对优势外,SpyRL 在每个骨干内部均为表中最佳。更难的 AMC、Olympiad-Bench、SuperGPQA 上,Qwen3-4B 平均为 35.9,SpyRL 达到 42.6,提升 6.7 分;R-Zero 与 Absolute Zero 分别只提升 1.6 和 3.6 分。
6.4 消融:真正有效的是完整闭环
Math500 从 68.2 起步,训练 100 epoch 后:
| 设置 | 最终准确率 | 解释 |
|---|---|---|
| 只训练 performer | 72.3 | 固定 detector 很快过时,奖励失真后平台化 |
| 只训练 detector | 69.2 | 会找 spy 不等于目标任务能力提升 |
| 移除 spy | 71.6 | 无信息不对称,缺少持续的对抗监督 |
| 完整 SpyRL | 79.5 | performer 与 detector 交替共同进化 |
同时联合更新两阶段会把五个数学基准平均分从基础模型的 42.4 降至 35.3;交替训练提升至 50.8。玩家数从 3 增至 5 时平均增益由 5.5 上升至 9.3,继续增至 6 或 8 后边际收益减弱,说明五人组在效果与 rollout 成本之间较合理。
6.5 代理信号与真实质量到底有多一致
论文在 GovReport 和 WritingPrompts 各运行 100 局,把每个输出收到的票数与 GPT-4o 的五人质量排序比较:怀疑票越多,平均质量排名越差。这是 SpyRL 成立的关键经验桥梁。
但实验只能支持“在这些环境、模型与任务上相关”,不能支持“投票奖励就是质量”。跨任务迁移也显示能力重叠有限:摘要训练可正向迁移至写作,写作训练也能小幅迁移至摘要;数学训练模型在五个摘要基准的胜率只有 41.7%–45.6%,在写作各维度为 38.5%–42.5%。代理任务增强的仍是与其 performing stage 重叠的能力,而不是无条件的通用智能。
7. 局限与风险
7.1 “身份可验证”不等于“质量可验证”
检测奖励 (\mathbb I[v_i=u]) 确实是确定的;performer 奖励却来自一组会学习、会偏移的 detector。论文证明了代理对质量的相关性,但没有给出保持这种相关性的充分条件,也没有排除长期训练后 reward hacking。更准确的结论是:RLSVR 构造了可验证的代理事件,并在本文任务上展示了它与目标质量的有效对齐。
7.2 退化算子仍是人为设计的任务接口
论文称不需要外部 verifier,但每个新领域仍要定义 (g(x)) 与检测规则。连续 span masking 对文本任务自然,对医疗决策、代码架构、科学假设或多模态控制是否能构造“有意义但不退化”的信息差并不明确。20% 与 40% 摘要遮蔽结果相近,只说明该范围不敏感,不代表任意退化方式都可靠。
7.3 共适应、串通与表面捷径
performer 和 detector 来自同一模型生态并共同演化,可能形成外部评审看不懂的协议、风格标记或群体偏见。论文通过保持主题与表面形式、交替训练、人评和替代 judge 缓解这一担忧,但没有测试跨模型 detector、对抗性 detector、隐藏模板变化或长期博弈中的 collusion。
7.4 评测覆盖仍有限
开放式核心任务只有摘要与创意写作,骨干主要是同一家族的 4B/8B 模型。人评由 10 名博士生完成 400 条写作样本,未报告多标注者对同一样本的一致性设计、人口背景或置信区间。摘要事实性也主要用 ROUGE-L 和 LLM 偏好衡量,没有系统报告 factual consistency、幻觉率或关键事实召回。
7.5 成本论证只覆盖外部 evaluator
SpyRL 不调用付费 judge 生成训练奖励,这是明确优势;但每个样本要生成五份 performing 输出、五次 detection 行为,并持续更新两阶段。论文给出单节点 8 GPU 配置,却没有报告总 GPU-hours、能耗、相对普通 GRPO 的吞吐或端到端成本。因此“无外部 verifier”不能简化成“低成本训练”。
7.6 安全含义值得单独研究
spy 的优化目标之一是信息不足时仍避免被识别,形式上是在训练“隐藏能力缺口、融入群体”。在普通摘要和写作上,这能促进补全与表达;在高风险领域,也可能强化策略性伪装或令人信服但不可靠的输出。论文未提供 ethics statement 或欺骗行为评测,部署前需要把任务边界、审计 detector 和独立事实验证分开设计。
8. 应用影响
8.1 值得尝试的方向
- 高成本人工偏好任务:产品文案、摘要、报告改写等可构造受控信息差,又能让多人比较结果的场景;
- 数据丰富但标签稀缺的领域:只有原始文档、缺少题目和答案时,用 document-level 信息构造环境比人工制作 question-level supervision 更便宜;
- Agent 训练环境:隐藏一部分工具、状态或上下文,让多个 Agent 通过任务表现推断隐藏条件;
- 自动课程学习:detector 与 performer 的能力差动态决定训练阶段,可持续把压力放在当前短板上。
8.2 不应直接替代的组件
SpyRL 不应替代医疗、法律、金融或安全系统中的事实验证器与责任审计。它优化的是群体相对表现,不保证事实正确、价值一致或遵守外部规范。更稳妥的组合是:用 RLSVR 扩大训练信号,再用独立规则、领域专家和真实后果指标做最终验证。
8.3 工程落地检查表
- 明确隐藏变量由环境生成且不会泄漏到表面格式;
- 证明 detection 成功必须依赖目标能力,而不是水印或长度;
- 持续测量票数与独立质量指标的相关性,而非只在训练前验证一次;
- 为不同角色使用独立 baseline,避免把结构性劣势写进梯度;
- 引入跨模型、人类或规则型外部审计,监控共适应和 reward hacking;
- 同时核算自博弈 rollout 成本与节省的 evaluator 成本。
9. 相关工作与论文定位
| 路线 | 代表工作 | 奖励来源 | 与 SpyRL 的差异 |
|---|---|---|---|
| 人类或 AI 偏好 | RLHF、DPO、RLAIF | 人类比较或模型偏好 | 覆盖开放任务,但需要偏好数据或 evaluator |
| LLM-as-a-Judge / rubric | MT-Bench、Rubrics as Rewards | judge 或 rubric executor | 奖励直指质量,但有能力上限、偏差与推理成本 |
| 自奖励模型 | Self-Rewarding Language Models | 模型评自己的输出 | actor 与 evaluator 能力耦合,仍是学习型评价 |
| proposer-solver 自博弈 | Absolute Zero、R-Zero | 可检查的 solver 结果 | 强于数学与代码,开放式任务缺少可靠校准 |
| 多智能体零和游戏 | SPIRAL、SPICE、SPAG | 游戏胜负或语料环境 | 多聚焦推理或游戏能力;SpyRL 把游戏结果回传给开放式 performing task |
| 生成式开放奖励 | Writing-Zero | principle-based generative reward model | 直接面向写作,但仍依赖生成式奖励模型 |
SpyRL 的位置不是简单增加一个更强 judge,而是把“如何评分”改写成“如何构造环境”。它与 self-supervised learning 的相似之处在于 label-by-construction,与 asymmetric self-play 的相似之处在于自动课程,与 RLVR 的相似之处在于最终检测奖励仍可按规则计算。
10. 结论
RLSVR / SpyRL 提供了一个值得继续发展的研究方向:当目标质量无法直接验证时,可以注入环境已知的隐藏变量,并设计一个必须运用目标能力才能解决的交互任务,从而获得规则化训练信号。论文在摘要、创意写作和推理上给出广泛且方向一致的收益,两阶段交替训练、角色优势校准、人评和替代 judge 也让证据链比单一 LLM 打分更完整。
它尚未把开放式质量变成真正的 ground truth。最关键的科学问题仍是代理博弈与真实目标之间的 alignment:这种关系在什么条件下成立,何时会被捷径、共适应或策略性伪装破坏,以及如何用独立指标持续审计。把 RLSVR 理解为“可验证代理环境的设计方法”,比把它理解为“开放式任务已有确定奖励”更准确,也更有助于判断其适用边界。
参考资料
- Qinsi Wang et al., From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement, COLM 2026.
- Hugging Face, Daily Papers: arXiv 2607.23802.
- SpyRL authors, RLSVR / SpyRL official repository.
- Andrew Zhao et al., Absolute Zero: Reinforced Self-play Reasoning with Zero Data, 2025.
- Chengsong Huang et al., R-Zero: Self-Evolving Reasoning LLM from Zero Data, 2025.
- Bo Liu et al., SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning, 2025.
- Ruipeng Jia et al., Writing-Zero: Bridge the Gap Between Non-verifiable Tasks and Verifiable Rewards, 2025.
- Anisha Gunjal et al., Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains, 2025.