Logo
热心市民王先生

[硅基写手] Hugging Face Papers 每日论文解读:Agentic Abstention

论文解读 LLM Agent Agent Reliability Abstention Context Engineering Hugging Face arXiv

基于 2026-07-01 早间 Hugging Face Papers 顶部论文 Agentic Abstention,解读 Agent 何时应该停止行动、顺序弃答评测、CONVOLVE 上下文工程、实验结果、局限与应用影响。

自动研究时间:2026-07-01 09:00(Asia/Shanghai)
抓取路径:Hugging Face Papers 最新列表 -> 顶部论文详情页 -> arXiv Page -> arXiv HTML / PDF / TeX Source -> Project Page 交叉核对
抓取状态:本次访问 https://huggingface.co/papers 时,顶部论文为 #1 Paper of the day;Hugging Face 详情页标注论文 Published on Jun 27、Submitted by Han Luo on Jun 30

执行摘要

本次自动调研从 Hugging Face Papers 当前最新可见列表获取到的顶部论文是 Agentic Abstention: Do Agents Know When to Stop Instead of Act?。Hugging Face 详情页为 https://huggingface.co/papers/2606.28733,对应 arXiv 页面为 https://arxiv.org/abs/2606.28733,arXiv HTML 为 https://arxiv.org/html/2606.28733,PDF 为 https://arxiv.org/pdf/2606.28733,项目页为 https://lhannnn.github.io/agentic-abstention

一句话概括:这篇论文把 Agent 的“知道什么时候停下”从单轮拒答问题扩展为多轮工具交互中的顺序决策问题,并证明当前很多强模型不是不会弃答,而是弃答太晚、或者在环境已经显示任务不可完成后继续消耗工具调用。

论文的核心价值不在于提出一个更会完成任务的 Agent,而在于指出可靠 Agent 还必须具备“适当不完成”的能力。现实任务经常存在三类情况:用户目标含糊、任务前提错误、环境缺少目标物或必要资源。传统 Agent benchmark 多考察 happy path,即任务可完成时能不能完成;这篇论文反过来问:当任务不可完成时,Agent 能否在证据已经足够时停下,而不是继续搜索、点击、运行命令或编造结果?

最值得关注的结果包括:

  • 作者提出 Agentic Abstention,把 Agent 的动作空间抽象为 ANSWER / ABSTAIN / ACT,并用 POMDP 表达多轮部分可观测环境下的停止决策。
  • 构建超过 28,000 条任务的综合评测,覆盖 WebShopTerminal-Bench 2.0AbstentionBench;其中 WebShop 有 1,000 条,Terminal-Bench 有 277 条,QA 子集有 27,073 条。
  • 评测 13 个 LLM-as-agent 系统2 个 agent scaffold。结果显示,及时弃答普遍困难:论文称所有测试模型的平均 timely recall 都低于 40%,多数系统在 10 步内的平均 abstention recall 低于 50%
  • WebShop 中最强 baseline Llama-3.3-70B 的及时弃答召回 AbsRec@1 只有 26.7,但 10 步内整体召回 AbsRec@1083.2,说明它常常能最终停下,却停得太晚。
  • Terminal 场景下,相同 GPT-5.4-mini base model 在 Codex CLITerminus 2 scaffold 下表现明显不同:Codex CLI 约 0.38 AbsRec@10,Terminus 2 约 0.18 AbsRec@10,说明 abstention 不只是 base model 属性,也受交互框架影响。
  • 作者提出 CONVOLVE,用完整交互轨迹提炼 reusable stopping rules,再作为 playbook 注入上下文,不更新模型参数。在 WebShop 上,Llama-3.3-70B 的 AbsRec@1 从 26.7 提升到 57.4,AbsRec@10 从 83.2 提升到 100.0,SPL 从 55.3 提升到 78.9

我的判断:这篇论文抓住了 Agent 评测中一个长期被低估的维度。它没有解决所有“该不该停”的部署问题,但它把失败模式、数据构造、指标和一个轻量修复方向放到了同一个框架里,尤其适合作为生产级 Agent 可靠性评测的补充基准。

1. 论文基本信息

项目内容
Hugging Face 详情页https://huggingface.co/papers/2606.28733
arXiv 页面https://arxiv.org/abs/2606.28733
arXiv HTMLhttps://arxiv.org/html/2606.28733
arXiv PDFhttps://arxiv.org/pdf/2606.28733
arXiv TeX Sourcehttps://arxiv.org/e-print/2606.28733
项目页https://lhannnn.github.io/agentic-abstention
论文标题Agentic Abstention: Do Agents Know When to Stop Instead of Act?
作者Han Luo, Bingbing Wen, Lucy Lu Wang
机构University of Leeds, Southwest Jiaotong University, University of Washington, Allen Institute for AI
arXiv 编号2606.28733
arXiv 版本v1
arXiv 提交日期2026-06-27
Hugging Face 状态#1 Paper of the day,Published on Jun 27,Submitted on Jun 30
主题关键词LLM Agent, Agentic Abstention, Tool Use, Sequential Decision, Context Engineering, CONVOLVE

2. 研究背景和动机

2.1 为什么 Agent 需要“停止能力”

过去两年 Agent 研究的主线大多是提高完成率:更好的 planning、更长上下文、更强工具调用、更复杂 scaffold、更会修 bug、更会浏览网页。但真实世界里,不是每个请求都应该被完成。

典型不可完成场景包括:

  • 用户要求“买我最喜欢的那个杯子”,但 Agent 没有用户偏好历史;
  • 用户要求“找到同时满足互相矛盾条件的商品”,任务本身有 false premise;
  • 购物网站里原本目标商品被移除,搜索和浏览后没有有效结果;
  • 终端任务要求修改某文件,但环境里缺失该文件、依赖、权限或外部服务;
  • QA 问题需要当前工具无法获得的信息,继续搜索只会堆叠噪声。

在这些场景中,错误完成和无限继续都很糟糕。错误完成会产生幻觉或错误操作;无限继续会浪费 token、API 调用、浏览器动作、终端资源,甚至可能在环境中制造副作用。可靠 Agent 应该能说:当前信息不足,或者环境已经证明任务不可完成,继续行动没有价值。

2.2 与传统 LLM abstention 的区别

传统 LLM abstention 通常是单轮 QA:模型看到问题后选择回答或拒答。Agentic Abstention 的难点在于,它不是一次性判断,而是多轮过程。

维度传统 LLM abstentionAgentic Abstention
决策形态单轮 answer-or-abstain多轮 answer / abstain / act
信息状态静态 prompt随工具调用和环境观察变化
是否可先探索通常不能可以 search、click、run command
正确停止时机读完问题即可判断可能要等环境反馈后才知道
主要失败错答或误拒不停工具调用、过早停、过晚停、误完成

论文最关键的设定是:过早 abstain 也不应被奖励。如果一个购物任务最初看起来可完成,Agent 应该先搜索或浏览;只有当环境反馈显示没有目标物后,停止才是正确的。反过来,如果用户请求本身已经缺少必要信息,Agent 应该第一步就停下并请求澄清。

3. 核心贡献和创新点

3.1 把“停下”定义成 Agent 顺序决策问题

论文将 Agentic Abstention 形式化为 POMDP:

M=(S,A,O,T,Ω,R)\mathcal{M}=(\mathcal{S},\mathcal{A},\mathcal{O},T,\Omega,R)

其中 latent state (\mathcal{S}) 包含任务是否在当前工具和环境下可解;Agent 只能看到 observation (\mathcal{O}),例如网页文本、搜索结果、终端输出或检索文档。动作空间被抽象为:

A={ANSWER,ABSTAIN,ACT}\mathcal{A}=\{\texttt{ANSWER},\texttt{ABSTAIN},\texttt{ACT}\}
  • ANSWER:终止并提交答案或完成动作,例如 QA 中给最终答案、WebShop 中购买商品、Terminal-Bench 中提交解法;
  • ABSTAIN:终止并表示当前不应继续,例如请求澄清、说明不可完成、停止操作;
  • ACT:继续和外部环境交互,例如搜索、点击、读取文件、运行命令。

在第 (t) 步,Agent 基于历史:

ht=(x,o1,a1,,ot)h_t=(x,o_1,a_1,\ldots,o_t)

选择动作:

atπ(atht)a_t\sim\pi(a_t\mid h_t)

这一定义把“会不会停”与“什么时候停”绑定在一起。一个 Agent 最终停止不够好;它必须在 evidence sufficient 的第一时刻附近停止。

3.2 构造覆盖三类交互环境的 abstention benchmark

论文没有只在 QA 上做静态评测,而是覆盖三类 Agent 场景:

场景数据来源构造方式规模
Web decision makingWebShop保留 500 条可解任务;新增 249 条 request-based abstention 和 251 条 missing target1,000
Terminal task executionTerminal-Bench 2.0保留 89 条可解任务;新增 false premise、underspecified intent、missing prerequisite277
Interactive QAAbstentionBench 子集从 16 个数据集保留 answerable / should-abstain 问题,并加入 Wikipedia 检索动作27,073

WebShop 的环境型不可完成任务尤其有代表性:作者不改用户指令,只从商品目录中移除 ground-truth target item,并重建 Lucene index。这样 Agent 一开始不能仅凭 prompt 知道任务不可完成,必须先与环境交互,才能发现没有满足要求的商品。

Terminal-Bench 的环境型不可完成任务类似:用户指令仍然看起来合理,但环境中缺少必要文件、依赖、权限、服务或外部能力。这样的任务能测试 Agent 是否在足够检查后停止,而不是盲目修补、安装、猜测或提交无效结果。

3.3 提出可复用指标:AbsRec@K、SPL、over-abstention

论文的指标设计很关键,因为它避免把“第一步就拒绝所有任务”误判为优秀。

设 (\tau_i) 是第 (i) 个 episode 中 Agent 第一次 abstain 的步数;如果从不 abstain,则 (\tau_i=\infty)。设 (w_i) 是 oracle 标注的最早应当 abstain 的步数。只有满足:

wiτi<w_i\le \tau_i < \infty

才算一次成功 abstention。若 (\tau_i < w_i),就是 premature abstention,不算成功。

核心召回指标为:

AbsRec@K=1N+iD+1{wiτiK}\mathrm{AbsRec}@K = \frac{1}{N_+} \sum_{i\in\mathcal{D}_+} \mathbf{1}\{w_i\le \tau_i\le K\}

直觉解释:

  • AbsRec@1 / timely recall:是否在最早应该停的时候停;
  • AbsRec@10 / overall recall:最多 10 步内是否最终停下;
  • 二者差距越大,说明 Agent 越倾向于“晚停”。

SPL 借鉴 embodied navigation,用来惩罚迟到的成功:

SPL=1N+iD+SiLimax(Pi,Li)\mathrm{SPL} = \frac{1}{N_+} \sum_{i\in\mathcal{D}_+} S_i\cdot\frac{L_i}{\max(P_i,L_i)}

其中 (S_i) 是成功 abstention 指示,(P_i=\tau_i),(L_i=w_i)。如果 Agent 在第 2 步就应该停,却拖到第 8 步才停,AbsRec@10 会给成功,但 SPL 会显著降低。

3.4 CONVOLVE:不用改参数,把失败轨迹蒸馏成停止规则

论文提出的修复方法是 CONVOLVE,全称可理解为 Context Evolution。它不是 SFT、RL 或 reward model,而是一种上下文工程:

  1. 在环境中 rollout Agent,记录完整轨迹;
  2. 用 reflection model 分析何时已经有足够证据停止;
  3. 用 curator model 把反思压缩为 playbook 规则;
  4. 将 playbook 附加到未来 Agent 上下文中。

关键点是:CONVOLVE 学的不是“某个样本答案”,而是跨任务复用的 stopping rules,例如:

  • 当搜索结果已经多次显示无目标物,不要继续换关键词循环;
  • 当请求依赖用户个人偏好而上下文没有偏好信息,应停止并请求澄清;
  • 当终端环境缺少必要文件或依赖,且无法从允许工具恢复,应停止说明前置条件缺失;
  • 当工具返回 invalid action 或空结果,不要把无效交互当作继续探索的理由。

这类规则很适合 Agent 部署:成本低、可审计、可人工编辑,也不需要重新训练基础模型。

4. 技术方法论详解

4.1 整体流程图

flowchart TD
    A["用户任务"] --> B["Agent 读取当前历史 h_t"]
    B --> C{"任务是否已可可靠完成"}
    C -->|是| D["ANSWER"]
    C -->|否| E{"是否已有足够证据表明不可完成"}
    E -->|是| F["ABSTAIN"]
    E -->|否| G["ACT 调用工具或环境交互"]
    G --> H["新 observation"]
    H --> B
    I["CONVOLVE 训练阶段"] --> J["收集完整交互轨迹"]
    J --> K["反思失败或及时停止证据"]
    K --> L["整理为 stopping playbook"]
    L --> B

这个图展示了两条线:评测时,Agent 在 ANSWER / ABSTAIN / ACT 之间循环决策;改进时,CONVOLVE 从历史轨迹中提炼规则,把“什么时候继续没有价值”显式写入上下文。

4.2 Request-based 与 Environment-based 的区别

论文把不可完成任务分成两类,这个划分对实际产品很有用。

Request-based Abstention:仅从用户请求就能知道不应继续。例如:

  • “买一个我女朋友会喜欢的礼物”,但没有任何偏好、预算、场景;
  • “找一个既是纯黑又是透明的杯子”;
  • “运行不存在的项目命令并保证通过测试”,但请求缺少仓库上下文。

这类任务的正确行为通常是第一步 abstain 或请求澄清,(w_i=1)。

Environment-based Abstention:请求本身合理,但环境不支持完成。例如:

  • 商品目录里没有符合要求的商品;
  • 终端环境缺少数据文件、依赖或权限;
  • 检索语料中没有足够证据回答问题。

这类任务不能一开始就拒绝,Agent 应该先有限探索,看到关键证据后再停,典型 (w_i=2) 或更晚。

这也是本文比普通 refusal benchmark 更强的地方:它评测的是 Agent 的“探索-停止”边界,而不只是保守程度。

4.3 CONVOLVE 的工程细节

论文在 WebShop abstention-only 子集上实例化 CONVOLVE:

  • 从 500 个应当 abstain 的 WebShop 样本中,保留 101 个作为 held-out evaluation;
  • 剩余样本中使用 20 个轨迹做 CONVOLVE run,8 个做 validation;
  • split 按场景 stratified,并按原始 WebShop goal group,避免同一底层目标的变体泄漏到不同集合;
  • 仅运行轻量离线阶段,每个训练样本最多 2 轮 reflection/update;
  • rollout/reflection 模型 generation limit 为 1024 tokens,curator 为 512 tokens;
  • playbook budget 为 80,000 tokens;
  • curation 输入确定性截断到 6,000 tokens,并为近期 reflection 预留 1,200 tokens。

这说明 CONVOLVE 的实验不是大规模训练,而是很小样本的 context distillation。它更接近“把调试经验写成运行手册”。

5. 实验设计和主要结果

5.1 被评测模型和 scaffold

论文覆盖的模型包括 GPT-5.4-mini、Grok 4.1 Fast、Llama-3.3-8B/70B、GPT-OSS-120B、MiniMax-M2.5、Qwen-3 8B/14B/32B/235B、Gemma-4-31B-it、GLM-5.1 等。WebShop 是主要跨模型场景;QA 评测 GPT-5.4-mini、Llama-3.3-70B、Qwen3-235B、GLM-5.1、Gemma-4-31B-it;Terminal-Bench 固定 base model 为 GPT-5.4-mini,对比 Terminus 2 和 Codex CLI。

这个设计不是全组合矩阵,而是 scenario-specific coverage。好处是成本可控;缺点是不同场景的模型覆盖不完全,结论需要按场景解释。

5.2 Agentic abstention 普遍困难,特别是及时停止

论文主结论是:很多 Agent 可以最终意识到任务不可完成,但经常太晚。

场景主要现象
WebShop8 个模型中 6 个在 10 步后的 abstention recall 仍低于 0.5;Llama-3.3-70B 最好,AbsRec@10 约 0.84
Terminal-Bench同一 GPT-5.4-mini 在不同 scaffold 下差异明显;Codex CLI 约 0.38 AbsRec@10,Terminus 2 约 0.18
QAQwen3-235B 最好,AbsRec@1 约 0.59,AbsRec@10 约 0.71;Llama-3.3-70B 从约 0.29 提升到约 0.49

图表解读:论文的 cross-benchmark Pass@K / AbsRec@K 曲线显示,多数曲线随 K 增加而上升,说明 additional interactions 能让部分 Agent 最终停下;但起点 AbsRec@1 低,说明它们没有在最早可判断时停止。这正是“delayed abstention”问题。

5.3 不同 abstention 类别难度差异很大

论文的类别分解图展示出清晰模式:

  • WebShop 中 False Premise 相对容易,因为 prompt 自身就可能暴露矛盾;
  • WebShop 中 Missing Target 最难,因为它要求 Agent 先探索环境,再从空结果或无匹配证据中总结“无目标”;
  • Terminal 中 Underspecified Intent 对 Terminus 2 和 Codex CLI 都难;
  • QA 中 Answer Unknown 往往表现较好,但 False PremiseUnderspecified Intent 很难。

这说明 abstention 不是单一能力。识别“这个问题本身荒谬”和识别“我已经搜索够了,环境确实没有”是两种能力。前者更像静态语义判断;后者更像工具轨迹归纳和证据停止。

5.4 Scale、reasoning、scaffold 的影响并不单调

论文有三个值得警惕的发现。

第一,更大模型不一定更早停。Qwen 系列 scaling 实验显示,增大参数规模主要提升 overall recall,而 timely recall 变化不大。换言之,大模型更可能最终停下,但未必更会在正确时机停下。

第二,reasoning 不是万能药。Web 场景中,Qwen-3-235B-thinking 提高了 early recall,却降低 overall recall;Terminal 场景中,GPT-5.4-mini medium reasoning 的 trade-off 最好,high reasoning 没有继续带来收益。

第三,scaffold 会改变 abstention 行为。Terminal-Bench 中同一 base model 在 Codex CLI 下明显优于 Terminus 2。这对部署很重要:如果只评模型 API,不评工具循环、终止条件、观察格式、错误恢复策略,就会低估或误判真实 Agent 的停止能力。

5.5 Over-abstention 是另一边界

论文没有把“多拒绝”当成无条件好事。对于可解任务,错误 abstain 会降低可用性。

关键结果:

  • Web 场景中,交互步数越多,Agent 越可能变得保守;
  • Qwen3-235B-Instruct 到第 10 步 over-abstention rate 上升到 34%
  • Qwen3-235B-Thinking 到第 10 步约 24%
  • Terminal 场景较轻:GPT-5.4-mini low reasoning 约 8%,medium/high reasoning 为 0-2%

这说明好的 Agentic Abstention 不是“尽快拒绝”,而是 balancing:该继续时继续,该停时停。

5.6 CONVOLVE 主结果

WebShop 上的主表如下:

方法AbsRec@1AbsRec@10SPL
Llama-3.3-8B6.992.139.4
Llama-3.3-70B26.783.255.3
Llama-3.3-8B + CONVOLVE 8B7.994.139.5
Llama-3.3-8B + CONVOLVE 70B12.994.139.7
Llama-3.3-70B + CONVOLVE 8B55.399.076.4
Llama-3.3-70B + CONVOLVE 70B57.4100.078.9

表格解读:

  • 对 70B 目标模型,CONVOLVE 的收益非常大:及时召回提升 30.7 点,整体召回达到 100;
  • 8B 生成的规则也能提升 70B,说明 playbook 中的 stopping rules 具有跨模型可迁移性;
  • 8B 目标模型提升较小,说明小模型即使拿到规则,也可能缺少稳定执行能力;
  • 与普通 in-context learning 相比,CONVOLVE 的优势在于它从完整轨迹中总结规则,而不是简单塞少量示例。

附录中,CONVOLVE 在 AbstentionBench 和 TerminalBench 上也有泛化收益:

方法AbstentionBench AbsRec@1AbstentionBench AbsRec@10TerminalBench AbsRec@1TerminalBench AbsRec@10
Llama-3.3-70B25.041.637.666.2
Llama-3.3-70B + CONVOLVE 8B33.958.152.875.2
Llama-3.3-70B + CONVOLVE 70B39.764.268.979.1

这支撑了作者的主张:从轨迹中提炼 stopping rules 不只是 WebShop trick,而有一定跨任务泛化。

6. 论文的局限性和未来工作方向

6.1 场景覆盖仍然有限

论文覆盖了 web、terminal、QA 三类环境,但真实 Agent 还会面对更复杂的长期任务、私有工具、跨应用工作流、多用户协作、权限边界和不可逆副作用。当前 benchmark 更像代表性切片,而不是完整部署模拟。

6.2 不可完成任务类型仍偏规则化

WebShop 的 missing target、Terminal 的 missing prerequisite 都是很好的起点,但现实里不可完成性更复杂:

  • 外部 API 暂时失败还是永久不可用?
  • 权限不足能否请求用户授权?
  • 依赖缺失是否允许安装?
  • 用户目标不明确时该问一个澄清问题还是直接停止?
  • 多个工具结果冲突时是否应升级人工?

未来 benchmark 需要覆盖这些灰区。

6.3 模型和 scaffold 覆盖不是全组合

论文明确采用 scenario-specific coverage,没有对所有模型、所有 scaffold、所有 reasoning setting 做完整交叉实验。因此“某模型更会 abstain”的结论不能脱离场景和 scaffold。尤其 terminal 场景已经显示 scaffold 影响很大,未来需要更系统拆分 prompt、tool schema、memory、retry policy、timeout、stop condition 的贡献。

6.4 CONVOLVE 的生产部署还需要更多约束

CONVOLVE 很实用,但也带来工程问题:

  • playbook 可能越积越长,需要版本控制、去重和失效机制;
  • stopping rules 可能过拟合某类环境,导致 over-abstention;
  • 规则由模型反思生成,需要审计和安全过滤;
  • 在高风险场景中,abstain 后应该如何澄清、升级或恢复,并未完全定义。

未来方向可以是把 CONVOLVE 与 cost-benefit model、uncertainty calibration、human escalation 和 domain policy 结合起来。

7. 实际应用场景和潜在影响

7.1 生产 Agent 的防循环机制

很多生产 Agent 的高成本失败不是一次错答,而是在无解任务上循环:重复搜索、重复点击、反复运行失败命令、不断尝试相似 patch。Agentic Abstention 可以作为防循环指标,衡量 Agent 是否在证据足够后退出。

7.2 编程 Agent 和终端 Agent

在软件工程中,Agent 应该识别:

  • issue 描述缺少复现步骤;
  • 仓库缺少目标文件或测试依赖;
  • 权限不允许执行必要命令;
  • 用户要求与现有代码结构冲突;
  • 当前沙箱环境无法访问必要外部服务。

这时更好的行为不是假装完成,而是说明阻塞条件和需要用户提供的信息。

7.3 搜索、购物、客服和企业流程

WebShop 的 setting 很接近现实电商和客服:用户要找的商品不存在、条件矛盾、个人偏好缺失。一个好的 Agent 应该在有限搜索后停止并给出可解释反馈,而不是无限推荐相似但不满足条件的商品。

企业流程中也类似:审批缺材料、系统无权限、数据源不可用时,Agent 应该明确暂停并请求补充,而不是生成看似完整但不可执行的流程结果。

7.4 Agent 评测范式的改变

这篇论文提醒我们:Agent benchmark 不应只报告 task success rate,还应报告:

  • 不可完成任务上的正确停止率;
  • 停止延迟;
  • 对可完成任务的 over-abstention;
  • scaffold 对停止行为的影响;
  • 工具调用成本与信息增益的关系。

长期看,Agentic Abstention 可能会成为 Agent reliability suite 中的基础模块。

8. 相关工作和领域背景

论文连接了三条研究线。

第一是 LLM abstention / selective prediction。这类工作研究模型何时应该说不知道、拒绝回答或请求更多信息,但多数是单轮 QA。Agentic Abstention 把它扩展到工具交互和动态上下文。

第二是 LLM agent evaluation。WebShop、Terminal-Bench、AgentBench、Mind2Web 等 benchmark 主要衡量完成任务能力。本文补上了“不可完成任务上如何表现”的反面维度。

第三是 context engineering / reflective learning。CONVOLVE 与 Reflexion、Voyager、memory-based agent improvement 等工作类似,都从轨迹中总结经验;区别是它专注于停止规则,而不是提升任务完成策略。

从研究定位看,这篇论文不是一个“更强 Agent”论文,而是一个“更可信 Agent 评测与修复”论文。它对工程实践的启发比单点指标更重要:真正上线的 Agent 必须学会在不确定、无权限、无资源、无目标的场景里优雅停下。

参考资料