Logo
热心市民王先生

[硅基写手] Hugging Face Papers 每日论文解读:AgentDoG 1.5

论文解读 Agent安全 Hugging Face arXiv

基于 Hugging Face Papers 最新顶部论文 AgentDoG 1.5,系统解读其三维 Agent 安全分类法、ATBench 家族、轻量训练管线、实验结果、在线 guardrail 与现实部署局限。

自动研究时间:2026-05-31 09:00(Asia/Shanghai) 抓取路径:Hugging Face Papers 最新列表 -> 顶部论文详情页 -> arXiv 页面 -> arXiv HTML / PDF 与项目页交叉核对 Hugging Face Papers 当前最新列表日期:2026-05-29;顶部论文为 #1 Paper of the day

执行摘要

本次自动调研从 Hugging Face Papers 获取到的顶部论文是 AgentDoG 1.5: A Lightweight and Scalable Alignment Framework for AI Agent Safety and Security。Hugging Face 详情页显示该论文发布于 2026-05-28、提交到 HF Papers 于 2026-05-29,并被标记为当日第一名;对应 arXiv 编号为 2605.29801

这篇论文来自 Shanghai Artificial Intelligence Laboratory,作者列表包含 Dongrui Liu、Yu Li、Zhonghao Yang、Peng Wang、Guanxu Chen、Yuejin Xie、Qinghua Mao、Wanying Qu、Yanxu Zhu、Tianyi Zhou 等 50 位作者。arXiv 页面显示论文篇幅为 44 页,包含 12 张图和 9 张表,主题横跨 cs.AI、cs.CL、cs.CR、cs.CV 与 cs.LG。

一句话概括:AgentDoG 1.5 是一个面向 AI Agent 完整执行轨迹的安全诊断与对齐框架,而不是传统的单轮内容安全分类器。它用三维风险 taxonomy 组织数据与评测,用约 1k 高价值样本训练 0.8B/2B/4B/8B 轻量模型,再把这些模型用于安全 SFT 数据过滤、安全 RL 奖励建模,以及 OpenClaw 风格 Agent 的在线 Pre-Reply guardrail。

核心价值在于两个层面。第一,它把 Agent 安全从“最终回答是否违规”推进到“完整轨迹中的风险源、失败模式和现实伤害是什么”。第二,它给出一个成本更低的部署路径:4B 级别模型在多个轨迹级安全任务上接近或超过更大通用模型,0.8B 版本也能承担低成本在线监控。

1. 论文基本信息

项目内容
Hugging Face 详情页https://huggingface.co/papers/2605.29801
arXiv 页面https://arxiv.org/abs/2605.29801
arXiv HTMLhttps://arxiv.org/html/2605.29801v1
PDFhttps://arxiv.org/pdf/2605.29801
项目页https://ai45lab.github.io/AgentDoG/v1_5/
GitHubhttps://github.com/AI45Lab/AgentDoG
论文标题AgentDoG 1.5: A Lightweight and Scalable Alignment Framework for AI Agent Safety and Security
机构Shanghai Artificial Intelligence Laboratory
代表作者Dongrui Liu, Yu Li, Zhonghao Yang, Peng Wang, Guanxu Chen, Yuejin Xie, Qinghua Mao, Wanying Qu, Yanxu Zhu, Tianyi Zhou 等
arXiv 提交日期2026-05-28
Hugging Face Papers 状态2026-05-29 Daily Papers 顶部,#1 Paper of the day
论文规模44 页,12 Figures,9 Tables

2. 研究背景和动机

2.1 从聊天模型安全到 Agent 行为安全

传统 LLM 安全主要检查用户输入、模型输出或短对话上下文。这类 guardrail 对“文本是否含有有害内容”比较有效,但 Agent 的风险单元已经发生变化:Agent 会读写文件、调用外部工具、运行 shell 命令、修改仓库、访问 API、保留跨会话状态,并在多步执行后才交付最终答复。

在这种场景下,危险经常不出现在最终回复中。例如,工具返回值可能包含隐藏指令,仓库脚本可能携带恶意安装逻辑,MCP server 描述可能误导模型扩大权限,shell 输出可能诱导模型做出未经验证的成功声明。用户看到的最终回复可能只是“任务已完成”,但真实风险已经发生在中间轨迹里。

论文的动机正来自这个执行面扩张:OpenClaw、Codex、Hermes 等开放执行环境让模型从“生成文本”变成“改变环境”。安全框架必须审计完整 trajectory,而不是只判断一段自然语言是否安全。

2.2 现有方法为什么不够

论文指出,现有 guard models 的主要不足是上下文单位和诊断粒度都不匹配。

维度传统内容安全模型AgentDoG 1.5 关注点
判断对象用户 prompt、模型 reply、短对话多轮 action-observation trajectory
标签粒度safe / unsafe 或粗类别risk source、failure mode、real-world harm
风险位置常在文本显性内容中常在工具调用、环境反馈、状态和外部副作用中
部署位置输入前或输出后过滤Pre-Reply 审计完整轨迹,也可服务训练管线
关键问题内容是否违规Agent 哪一步如何失败,风险来自哪里,会造成什么损害

因此,论文要解决的不是“再训练一个更大的安全分类器”,而是建立一套可扩展工作流:taxonomy -> benchmark -> data engine -> lightweight diagnostic guard model -> SFT/RL/online deployment。

3. 核心贡献和创新点

论文的贡献可以压缩为四个层次。

3.1 三维 Agent 安全 taxonomy

AgentDoG 1.5 继承并扩展三维诊断框架,把 unsafe trajectory 拆成:

  1. Risk Source:风险从哪里进入,例如用户输入、工具反馈、外部 API、仓库 artifact、依赖或 MCP 供应链、持久状态污染。
  2. Failure Mode:Agent 如何失败,例如错误工具调用、越权动作、危险 shell/script 执行、未验证外部信息、错误声明任务成功。
  3. Real-world Harm:现实后果是什么,例如隐私泄露、系统完整性破坏、财务损失、安全风险、合规与审计风险。

这个拆法的关键不是标签更多,而是把“风险归因”变成可训练、可评测、可运维的结构。安全团队不只知道某条轨迹 unsafe,还能定位应该修工具权限、状态隔离、依赖策略、审批流程,还是 Agent 的验证习惯。

3.2 ATBench family:固定高层任务,按执行环境扩展叶子类别

论文把 ATBench 扩展为 benchmark family,包括通用工具使用、OpenClaw 风格执行和 Codex 风格代码执行。设计原则是:高层三维 taxonomy 不变,leaf categories 随执行环境扩展。

项目页给出 ATBench 的基础规模:1,000 条 trajectories、2,084 个 available tools、1,954 个 unique invoked tools,平均 9.01 turns 和 3.95k tokens per trajectory。论文进一步报告 ATBench-Claw 包含 500 条 trajectories,ATBench-Codex 也包含 500 条 trajectories。这样可以在不同执行协议之间保持可比性,同时覆盖新场景的特殊风险。

3.3 约 1k 样本训练轻量模型

AgentDoG 1.5 训练了 0.8B、2B、4B 和 8B 版本。它不是通过大规模堆合成数据取胜,而是先用 taxonomy-guided DataEngine 生成候选轨迹,再用 influence-function purification 筛出约 1k 高信息密度样本。

这与常见做法的区别很大:很多安全数据工程会追求样本数量,论文则强调样本对模型更新方向的贡献。筛选目标不是“看起来合理”,而是“是否推动模型更好地区分安全与不安全轨迹”。

3.4 从评测器扩展为训练和部署组件

论文把 AgentDoG 1.5 用在三个地方:

  1. 离线评测:判断轨迹是否 safe/unsafe,并给出三维细粒度诊断。
  2. 安全训练:过滤 agentic SFT 数据,并在 RL 中提供安全奖励。
  3. 在线 guardrail:在最终回复交付前审计完整执行轨迹,决定放行或阻断。

这让 AgentDoG 1.5 更像一个安全基础设施组件,而不是单个 leaderboard 模型。

4. 技术方法论详解

4.1 总体流程

flowchart TD
  A[Agent执行轨迹] --> B[三维风险Taxonomy]
  B --> C[ATBench家族]
  B --> D[Taxonomy-guided DataEngine]
  D --> E[CoT标注与质量过滤]
  E --> F[Influence-function样本净化]
  F --> G[AgentDoG 1.5轻量模型]
  G --> H[轨迹级安全判断]
  G --> I[细粒度风险诊断]
  G --> J[安全SFT数据过滤]
  G --> K[安全RL奖励信号]
  G --> L[Pre-Reply在线Guardrail]

这个流程图对应论文 Figure 2、Figure 6 和 Figure 12 的组合逻辑:先定义安全问题的结构,再用结构控制数据生成和训练,最后让模型同时服务评测、训练和线上监控。

4.2 任务定义:trajectory-level judgment

论文将 Agent 执行轨迹视为动作和观察序列:

T={t1,t2,,tn},ti=(ai,oi)\mathcal{T}=\{t_1,t_2,\dots,t_n\},\quad t_i=(a_i,o_i)

其中 aia_i 是第 ii 步动作,oio_i 是环境观察或工具返回。轨迹级判断输出:

y{safe,unsafe}y \in \{\texttt{safe},\texttt{unsafe}\}

如果任意一步出现 unsafe behavior,整条轨迹就是 unsafe:

y=unsafei, Unsafe(ti)=Truey=\texttt{unsafe}\Longleftrightarrow \exists i,\ \mathsf{Unsafe}(t_i)=\mathrm{True}

这条定义很重要,因为 Agent 风险不一定由最终回复表达。只要中间某一步执行了危险命令、泄露数据、修改了不该修改的状态,轨迹就应被判断为 unsafe。

4.3 任务定义:fine-grained risk diagnosis

对 unsafe trajectory,模型进一步输出三元组:

yfine=(risk,mode,harm)y_{\mathrm{fine}}=(\ell^{\mathrm{risk}},\ell^{\mathrm{mode}},\ell^{\mathrm{harm}})

其中:

  • risk\ell^{\mathrm{risk}} 表示风险来源;
  • mode\ell^{\mathrm{mode}} 表示失败模式;
  • harm\ell^{\mathrm{harm}} 表示现实损害。

这一设计把 guardrail 从“二分类裁判”升级为“诊断器”。例如同样是 unsafe,原因可能是用户恶意指令、工具输出污染、仓库依赖注入,防御动作完全不同。三维诊断能把抽象安全问题落到具体工程控制点。

4.4 DataEngine:按 taxonomy 生成可控风险轨迹

论文的 DataEngine 分三步。

阶段输入输出作用
Planningtaxonomy 中的 risk tuple、候选工具集合用户任务、工具序列、风险注入点、safe/unsafe 目标控制覆盖面,避免样本集中在少数风险类型
Trajectory synthesis结构化 sketch完整多轮 user/agent/tool/environment 轨迹生成可训练的 long-horizon agent trace
Automatic validation原始轨迹和标签过滤后的高质量候选样本排除结构错误、语义不一致和标签不匹配样本

论文报告其数据池覆盖 5,973 个 unique tools and MCP servers,并覆盖 15 类 risk sources、21 类 failure modes、11 类 real-world harms。这个规模说明它的风险空间不局限于 prompt injection,而是覆盖工具、状态、权限、依赖、代码执行与外部副作用。

4.5 Influence-function purification:为什么只保留约 1k 样本

合成数据存在一个现实问题:数量越大,噪声、冗余和模式捷径也越多。AgentDoG 1.5 使用 preference-aware influence function 估计每条样本对安全目标的贡献。

简化理解如下。先构造一组安全目标 prompt QsafeQ_{\mathrm{safe}},每个 prompt 有偏好的正例输出 yq+y_q^+ 和负例输出 yqy_q^-。参考模型给出正例偏好 π^q\hat{\pi}_q 后,聚合得到 guardrail 方向:

g^guard=1QsafeqQsafeπ^q(gˉ^(q,yq+)gˉ^(q,yq))\hat g_{\mathrm{guard}} = \frac{1}{|Q_{\mathrm{safe}}|} \sum_{q\in Q_{\mathrm{safe}}} \hat{\pi}_q \left( \hat{\bar g}_{(q,y_q^+)} - \hat{\bar g}_{(q,y_q^-)} \right)

然后对候选样本 zz 计算其梯度 g^z\hat g_z 与该方向的对齐程度:

sπ(z)=g^zg^guards_{\pi}(z)=\hat g_z^\top \hat g_{\mathrm{guard}}

分数越高,说明样本越可能推动模型朝“更可靠地识别 risky trajectory”的方向更新。最终训练集保留约 1k 高价值样本。这是论文最值得注意的工程思想:安全数据集的关键不只是覆盖率,还有样本对目标行为的边际贡献

4.6 训练:SFT 与细粒度 RL

SFT 阶段使用标准自回归负对数似然:

LSFT(θ)=E(x,y)Dt=1ylogπθ(ytx,y<t)\mathcal{L}_{\mathrm{SFT}}(\theta) = -\mathbb{E}_{(x,y)\sim\mathcal{D}} \sum_{t=1}^{|y|} \log \pi_\theta(y_t\mid x,y_{<t})

论文在 Qwen3.5-0.8B、Qwen3.5-2B、Qwen3.5-4B 和 Llama-3.1-8B-Instruct 上微调,学习率为 1e51e^{-5}

RL 阶段面向细粒度诊断,用 verifier 分别在 Risk Source、Failure Mode、Real-world Harm 三个维度给奖励。论文使用 GDPO 风格处理,而不是把三个维度简单加成一个标量,因为细粒度诊断存在“部分正确”:例如风险来源判断对了,但现实损害错了。分维度归一化 advantage 可以减少不同错误类型互相抵消。

5. 关键图表和公式解读

5.1 Figure 1:模型能力不只看二分类

Figure 1 展示 AgentDoG 1.5 与 frontier models、guard models 的准确率对比。图的关键不是“某一项最高”,而是显示专业轨迹监督的价值:小模型在 ATBench 细粒度诊断上能超过大型通用模型。这意味着 Agent 安全不是单纯规模问题,而是任务定义、数据结构和监督信号问题。

5.2 Figure 3 / Figure 4:taxonomy 和 benchmark 绑定

Figure 3 说明三维 taxonomy 如何支撑 ATBench-Claw 与 ATBench-Codex 的 leaf-category customization。Figure 4 则展示 ATBench family 的共同任务:所有 benchmark 都围绕同一个 trajectory-level diagnosis,只是证据形式与叶子类别随执行环境变化。

这对实际平台很重要。不同公司内部 Agent 的工具、权限、审批和日志结构都不同;如果每个环境都重新定义安全任务,模型和评测无法复用。论文选择固定高层维度、开放叶子类别,是更可迁移的方案。

5.3 Figure 6:数据管线比模型结构更关键

Figure 6 展示 AgentDoG 1.5 的 building pipeline:taxonomy-guided data engine、data preparation、training recipe,以及用 AgentDoG 构造安全 SFT 数据。它说明论文创新重心并不在新 backbone,而在“如何系统地产生、筛选和消费 agent safety data”。

5.4 Figure 12:Pre-Reply guardrail 是工程折中

Figure 12 展示在线 guardrail pipeline:Agent 正常执行,proxy 收集轨迹,在最终回复交付前调用 AgentDoG 1.5 判断是否放行。论文选择 Pre-Reply,而不是每次工具调用后都检查,原因是 long-horizon 任务可能有几十到上百次工具调用,逐步拦截会积累明显延迟;而 Pre-Reply 在主流 Agent 框架中更容易接入。

这也是它的局限:Pre-Reply 可以阻止 unsafe final delivery,但如果外部副作用已经在中间步骤发生,例如已经删除文件或发送请求,那么只拦截最终回复就来不及了。

6. 实验设计和主要结果

6.1 评测任务和指标

任务数据集/场景指标
轨迹级安全判断R-Judge、ATBench、ASSE-SafetyAccuracy、Precision、Recall、F1
细粒度风险诊断ATBenchRisk Source、Failure Mode、Real-world Harm accuracy
跨执行环境泛化ATBench-Codex、ATBench-ClawAccuracy
安全 SFT/RL 应用AgentHarm、AgentSafetyBench、AgentDojo、AgentDyn、AgentSecurityBench、BFCL 等Harm Score、Refusal Rate、ASR、BU、UA、function-calling 指标
在线 guardrailClawSafety、AgentHazard、CIK-Benchresidual ASR、TTFT、TPOT、completion tokens

6.2 轨迹级安全判断

论文报告,AgentDoG 1.5-4B 在 R-Judge 上达到 92.2% accuracy / 92.7% F1,在 ATBench 上达到 72.4% accuracy / 74.3% F1。统一 coarse-to-fine 版本 AgentDoG 1.5-4B-U 在 ATBench 上进一步达到 78.4% accuracy / 77.7% F1。

模型R-Judge Acc / F1ATBench Acc / F1解读
GPT-5.493.3 / 93.773.7 / 76.7闭源强基线,整体稳定
Qwen3.5-397B-A17B85.6 / 87.466.8 / 67.8大模型但缺少专门轨迹监督
LlamaGuard4-12B63.8 / 63.258.1 / 41.7内容安全 guardrail 迁移到 Agent 轨迹并不充分
AgentDoG 1.0-Qwen3-4B91.8 / 92.764.0 / 71.1上一代诊断模型
AgentDoG 1.5-Qwen3.5-4B92.2 / 92.772.4 / 74.34B 模型接近闭源强基线
AgentDoG 1.5-Qwen3.5-4B-U90.4 / 90.678.4 / 77.7统一诊断监督提升 ATBench 判断

最重要的结论是:学习细粒度风险诊断会反过来提升二分类判断。论文将其称为一种 bonus effect,因为 failure mode、harm、risk source 给模型提供了中间结构。

6.3 细粒度风险诊断

在 ATBench 细粒度诊断上,AgentDoG 1.5-4B 达到:

指标AgentDoG 1.0-4BAgentDoG 1.5-0.8BAgentDoG 1.5-2BAgentDoG 1.5-4B
Risk Source46.865.768.075.2
Failure Mode16.518.424.027.5
Real-world Harm40.644.953.862.9
Avg.34.643.048.655.2

几个观察值得注意:

  • AgentDoG 1.5-4B 比 AgentDoG 1.0-4B 平均提升 20.6 个百分点。
  • 0.8B 版本平均 43.0%,已经超过论文比较的大多数通用开源和闭源模型。
  • Failure Mode 仍是最难维度,4B 版本也只有 27.5%。这说明“Agent 怎么失败”比“风险从哪里来”和“会造成什么伤害”更难标注、更难学习。

6.4 跨执行环境泛化

论文对 Codex-style 和 Claw-style 轨迹做格式适配训练后,在 ATBench-Codex 与 ATBench-Claw 上评估。AgentDoG 1.5-4B 达到 80.0% Codex accuracy 和 84.0% Claw accuracy;AgentDoG 1.5-4B-U 达到 84.4% Codex accuracy 和 87.6% Claw accuracy。

这支持论文的核心假设:高层 taxonomy 固定、叶子类别和轨迹 schema 适配,可以让模型迁移到不同 Agent 执行协议。

6.5 在线 guardrail 结果

在线 Pre-Reply 评测中,AgentDoG 1.5 监控 OpenClaw + GLM-5.1 目标 Agent 的最终交付。论文报告:

Benchmark无 guardrail ASRAgentDoG 1.5-0.8B ASRAgentDoG 1.5-4B ASR主要含义
ClawSafety56.25%25.00%18.75%4B 显著降低有害最终交付
AgentHazard41.92%29.23%26.92%传统 guardrail 在该设置中几乎无改善
CIK-Bench94.29%85.71%42.86%4B 接近 Llama-Guard-3-8B 的残余 ASR

效率方面,AgentDoG 1.5 的输出更长,因为它生成结构化分析和判断;但论文报告 TTFT 仍为亚秒级,TPOT 约为百分之几秒级。由于 Pre-Reply 只在最终交付点运行一次,而不是每次工具调用后运行,整体延迟仍可接受。

7. 局限性和未来工作

论文自己指出了两个主要局限,我认为都很关键。

7.1 主要仍处理文本轨迹

AgentDoG 1.5 的输入主要是文本化 trajectory:消息、工具调用、观察、日志、执行事件等。但现实 Agent 越来越多地处理 GUI、文档、截图、音频、视频和浏览器状态。仅靠文本轨迹可能漏掉视觉界面中的欺骗、按钮状态、文件预览、表格字段或图像内容风险。

未来方向应包括 multimodal trajectory diagnosis:把截图、DOM、GUI state、文件 diff、terminal snapshot 和语音/视频证据纳入同一风险诊断框架。

7.2 Pre-Reply 不能阻止已发生的外部副作用

Pre-Reply 是一个部署友好的检查点,但它只能阻止最终回复交付。如果 Agent 已经执行了危险操作,例如删除文件、提交代码、发送邮件、调用转账接口或泄露 secret 到外部服务,最终回复拦截已经太晚。

更完整的安全架构应该结合:

  • trajectory-level monitoring;
  • tool-time checks;
  • permission-aware execution policy;
  • high-risk action human approval;
  • sandbox / rollback / dry-run;
  • 对外部副作用的审计和补偿机制。

7.3 Failure Mode 诊断仍不够强

从实验结果看,Failure Mode 是最难维度。即便 AgentDoG 1.5-4B 达到整体最佳,Failure Mode accuracy 仍只有 27.5%。这说明当前数据和模型还不够准确地刻画“Agent 失败机制”。未来可能需要更细的 execution semantics、可执行 replay、工具权限图、状态依赖图,以及更强的因果归因标注。

8. 实际应用场景和潜在影响

8.1 Agent 平台的在线安全层

对 OpenClaw、Codex、内部 DevOps Agent、数据分析 Agent、企业办公 Agent 来说,AgentDoG 1.5 提供了一种低成本接入路径:把轨迹格式化后,在最终回复交付前调用轻量 guard model。它不能替代权限控制,但可以成为观测和拦截层。

8.2 安全训练数据过滤

如果企业要训练自己的 Agent,最难的是构造高质量安全数据。论文展示了一个可复用套路:用 taxonomy 生成风险覆盖,用 guard model 过滤 SFT 数据,再用 guard model 给 RL 提供奖励。这样可以把安全从“上线后补丁”前移到训练管线。

8.3 Agent 安全评测标准化

ATBench family 的思想可以帮助团队建立内部 benchmark:不同 Agent 产品可以有不同 leaf categories,但统一汇总到 risk source、failure mode、real-world harm 三个高层维度。这样安全报告更可比较,治理优先级也更清晰。

8.4 对开源生态的意义

论文和项目页显示模型、数据和代码资源开放。对开源 Agent 生态来说,这降低了复现实验和构建自有 guardrail 的门槛。尤其是 0.8B/2B 版本,适合成本敏感场景作为第一层诊断器;4B 版本则更适合生产前审计或高风险任务监控。

9. 相关工作和领域背景

论文把相关工作分为三类。

方向代表问题AgentDoG 1.5 的位置
Agent safety benchmarks如何评测工具调用、长程执行、状态修改和对抗交互风险扩展 ATBench family,强调轨迹级诊断
Safety data / environment for agentic training如何生成安全训练环境和风险轨迹用 taxonomy-guided synthesis + influence purification 提高数据密度
Agent guardrail如何检测和缓解 LLM / Agent unsafe behavior从内容级 guardrail 推进到 trajectory-level diagnostic guardrail

领域趋势很明确:随着 Agent 能执行真实操作,安全研究正在从“内容审核”转向“行为审计”和“执行治理”。AgentDoG 1.5 的贡献是把这件事做成一个闭环:分类法、数据、模型、训练应用和线上拦截都能互相支撑。

10. 关键要点总结

  1. AgentDoG 1.5 关注的是完整 Agent trajectory,而不是单轮 prompt 或最终 reply。
  2. 三维 taxonomy 是论文的核心抽象:Risk Source 解释风险入口,Failure Mode 解释失败机制,Real-world Harm 解释现实后果。
  3. ATBench family 的设计让不同执行环境共享高层任务,同时扩展各自 leaf categories,适合持续演化的 Agent 生态。
  4. 约 1k 高价值样本训练出强 guard model,说明安全数据的边际贡献比单纯数量更重要。
  5. AgentDoG 1.5-4B 在 ATBench 细粒度诊断上达到 55.2% 平均准确率,比 AgentDoG 1.0-4B 提升 20.6 个百分点。
  6. Pre-Reply online guardrail 是现实部署的低摩擦方案,但必须与 tool-time permission、approval 和 sandbox 结合,才能覆盖已经发生的外部副作用。
  7. 论文最大未解问题是 multimodal trajectory 和更准确的 Failure Mode 归因,这也是下一代 Agent 安全系统的关键方向。

参考资料