热心市民王先生

AREX

#论文解读 #Hugging Face #深度研究智能体 #递归自改进

基于 Hugging Face Daily Papers 2026-07-24 榜首论文,深入解读 AREX 如何把约束级验证变成研究轮次之间的控制信号,并结合自主上下文更新、关键步骤监督与长程强化学习构建递归自改进的深度研究智能体。

自动研究时间:2026-07-25 09:01(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Jul 24,列表最顶部为 AREX;详情页标注 #1 Paper of the day
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> 20 页 arXiv PDF 与完整 HTML -> 项目页、代码仓库和 Hugging Face 模型页交叉核对。

执行摘要

许多 Deep Research 系统把“投入更多推理预算”近似等同于“沿一条轨迹搜索更久”。问题在于,延长轨迹并不保证研究持续进步:早期错误可能被带入后续推理,已经排除的候选会被重复访问,部分满足约束的答案也可能被过早接受。AREX 的出发点是发现—验证不对称性:在巨大搜索空间中发现一个同时满足多项约束的答案很难,但给定候选后,逐项检查时间、数值、实体关系、技术属性和证据要求,往往容易得多。

论文据此把验证从“答案生成后的最后一道过滤器”升级为“研究轮次之间的状态转移”。内层研究循环负责搜索、浏览、整合证据并给出暂定答案;外层自改进循环逐项审计约束,根据答案级置信度选择接受、带着有效进展继续细化,或放弃被污染的轨迹后重新开始。每轮留下的不是一段泛化摘要,而是由模型自主生成的 improvement state:已验证发现及来源、当前与已排除候选、未解决约束、有效性风险和下一步计划。

AREX 还把这一推理结构延伸到训练。作者先合成具有唯一答案、可验证约束和多跳难度的研究任务,再筛选强教师模型产生的工具调用轨迹;随后依次训练浏览、多轮工具使用、专家推理和混合能力,并对“首次发现决定性证据”“否定错误方向并转向”“关键上下文更新”等高价值步骤额外施加监督。强化学习阶段采用按步骤归一的策略目标,并只在最终成功的轨迹中给予关键步骤有限奖励,避免长轨迹和常规步骤淹没真正决定成败的动作。

结果显示,122B 总参数、每 token 激活 10B 参数的 AREX-Base 在 BrowseComp、GAIA、xbench-2510、DeepSearchQA、WideSearch-en 和 HLE(text-only)上分别取得 82.5、85.4、71.0、89.9、82.0 和 52.4。最有解释力的不是跨模型总榜,而是同一系统内的 BrowseComp 消融:自主上下文更新带来 11.8 个百分点,外层循环在启用自主更新时再带来 11.1 个百分点,两者都关闭的 59.6 与完整系统的 82.5 相差 22.9 个百分点。

不过,“递归自改进”在本文中是受固定工具、置信阈值和最多五次外循环约束的测试时改进,不是模型自主修改权重、训练代码或目标函数。论文没有披露训练数据规模、教师模型、置信阈值、主要训练超参数、训练计算量、推理 token/时延/工具成本,也只在 BrowseComp 上做核心机制消融。更准确的评价是:AREX 为长程研究智能体提供了一个有实证支撑的“验证—状态压缩—定向再研究”闭环,但尚未证明它在等成本条件下普遍优于其他推理扩展策略。

1. 论文基本信息

项目内容
论文标题AREX: Towards a Recursively Self-Improving Agent for Deep Research
论文编号arXiv:2607.21461
arXiv 版本v1,2026-07-23 提交
Hugging Face 状态2026-07-24 Daily Papers 榜首,#1 Paper of the day
作者Shuqi Lu、Chaofan Li、Kun Luo、Zhang Zhang 等 24 位作者
研究机构Beijing Academy of Artificial Intelligence(BAAI)
学科分类Artificial Intelligence(cs.AI)
模型版本AREX-Turbo:Qwen3.5-4B 稠密模型;AREX-Base:Qwen3.5-122B-A10B MoE
推理接口searchvisitupdate_contextfinish;HLE 额外提供 Python
论文规模20 页,5 张表,附相关工作与简化设置下的自蒸馏探索
开放资源两个模型权重、最小推理示例与 BrowseComp 完整提示词;模型采用 Apache-2.0

核心链接:

2. 背景与动机:为什么“搜索更久”不等于“研究更深”

2.1 多约束问题的难点在于联合满足

Deep Research 的目标通常不是找到一个包含关键词的网页,而是构造一个同时满足多项条件的答案。例如,候选必须满足特定时间范围、数值关系、实体关联、技术特征与来源要求。单个条件可能容易检索,但它们的交集在搜索空间中很稀疏。

沿单一轨迹不断追加搜索和推理,会出现三类结构性问题:

  • 错误继承:早期误判成为后续查询的前提,更多搜索反而围绕错误候选积累材料;
  • 进度丢失:上下文截断或泛化摘要丢掉来源、反证和“为什么排除某候选”,导致重复探索;
  • 停止失准:系统缺少对每项约束的显式状态,只能凭整体感觉决定继续或结束。

AREX 认为,既然候选已经给定,验证往往可以拆成更容易处理的逐约束检查。验证结果不只给出“对或错”,还产生一个可操作的中间状态:哪些主张已有可靠证据,哪些仍然缺失,哪些证据互相冲突,下一轮应该查什么。

2.2 现有三条路线之间缺少闭环

论文将既有工作概括为三类:

  1. 工具增强与推理时扩展让智能体沿轨迹搜索、阅读和推理更久;
  2. outcome ranking、process supervision 或 critic 使用验证来筛选答案、评价局部动作;
  3. 长上下文、分层记忆、固定摘要和显式 memory action 管理持续增长的历史。

这些能力各自有用,但如果验证只是末端打分、记忆只是按 token 阈值压缩,系统仍不知道如何把“部分验证的答案”转换为“下一轮更窄、更有效的研究问题”。AREX 的核心设计正是连接这三者:验证产生状态,状态驱动压缩,压缩后的未解决约束驱动下一轮工具使用。

3. 核心贡献

3.1 把验证定义为研究轮次的转换算子

AREX 的关键概念不是多一层循环本身,而是外层循环如何决定状态转移。内层 finish 输出三个对象:

  • 面向原始问题的暂定答案;
  • 支持答案的证据及文档标识;
  • 综合完整性、一致性、来源可追溯性和时间有效性的答案级置信度。

外层根据置信阈值采取三种动作:

动作触发条件状态处理
Accept置信度超过阈值返回当前答案
Refine置信度不足,但轨迹包含可复用进展保留可靠发现,把未解决问题改写为定向目标
Restart轨迹噪声大、误导性强或缺乏有效信息丢弃轨迹,从原问题重新研究

这一区分很重要。简单 retry 会把每轮都当成独立抽样,简单 continue 又会把所有旧错误继续带入;AREX 尝试在二者之间选择“保留哪些进展”。如果达到最大轮数仍没有答案越过阈值,系统返回已完成答案中置信度最高的一个。

3.2 自主上下文更新不是普通摘要

长程工具调用会积累搜索结果、冲突证据、失败查询、旧计划与被排除候选。固定截断按位置删除内容,固定 token 阈值摘要只解决长度问题,却不一定在研究发生转折时更新。

AREX 提供显式的 update_context 工具,由当前模型自主判断何时调用。更新后的 improvement state 保留:

  • 已验证发现与来源标识;
  • 当前仍有可能的候选;
  • 未解决约束;
  • 来源、时效或一致性方面的有效性风险;
  • 已排除候选及其反证;
  • 下一步研究计划。

冗余观察、被新证据推翻的结论和过时计划则被删除。调用后,模型基于刷新后的状态继续,而不再携带更新之前的完整轨迹。它可以一轮调用多次,也可以完全不调用;只有触及 128K active context 上限时才被强制更新。

BrowseComp 行为统计说明它主要是语义动作,而不是长度保险:

指标结果
至少调用一次 update_context 的样本80.3%
调用时平均 active context25,721 tokens
调用时中位 active context25,386 tokens
在 128K 上限附近触发的更新0.01%
因修改搜索策略触发66.9%
因排除候选触发13.6%
更新中保留未解决约束95.5%
更新中保留下一步计划96.4%
更新中保留已排除候选81.5%

平均调用点远低于硬上限,支持作者关于“模型在研究转折点主动刷新状态”的解释。不过,这些 trigger 与 content 类别如何自动标注、分类误差多大,论文没有详细给出。

3.3 可验证的递归研究任务与教师轨迹

训练任务覆盖三类场景:

  • 浏览密集型:跨多个来源检索和整合;
  • 推理密集型:多步规划、演绎和假设比较;
  • 科学文献型:跨论文综合学术证据。

人类专家先定义答案格式、可用来源、推理要求和验证标准。系统再从网页、论文、结构化知识库和公共代码仓库中选择潜在答案,提取一组可验证约束,并把约束改写为需要多跳搜索的间接描述。

一个任务只有同时满足以下条件才被保留:

  1. 不能直接从题面推断答案;
  2. 每项约束都有可获得证据;
  3. 联合约束唯一确定答案;
  4. 自动检查通过正确性、唯一性、证据可用性和难度门槛;
  5. 独立 research rollout 不能用浅层检索轻易解决,也不能在充分探索后仍不可解。

强教师模型随后在与 AREX 相同的工具环境中生成包含分析、工具调用、观察和结构化答案的完整轨迹。质量门会删除直接猜答案、不根据观察修正、工具调用无效、引用不可靠、答案无法由已收集证据重建,以及答案级置信度低于阈值的轨迹。

这套管线的价值在于把训练目标从“模仿最终文本”扩展为“模仿研究过程”。但论文没有披露任务数量、三类数据占比、教师模型身份、通过率和人工抽检一致性,因此外部读者无法判断数据规模与质量门各自贡献了多少。

3.4 渐进式 agentic mid-training

作者认为,把工具调用、网页导航、专家推理、文献研究和答案综合从一开始混在同一分布中,容易产生能力干扰。训练因此分为三个相连阶段:

  1. 浏览能力建立:先学习多轮搜索、网页阅读、证据获取、查询改写和答案综合;
  2. 专家推理强化:再引入长链思考、多步推理、假设验证和困难问题求解;
  3. 混合能力巩固:加入复杂论文研究和知识密集任务,同时选择性回放浏览轨迹中的关键步骤,恢复可能被推理训练削弱的工具使用。

匹配总体训练预算的消融中,把渐进式训练替换为从头混合训练,BrowseComp 从 82.5 降至 77.5,差 5.0 个百分点。这支持“训练顺序可减少异质能力干扰”,但目前仅在单一 benchmark、单一模型配方上得到验证。

3.5 关键步骤监督:把损失集中到真正困难的决策

长轨迹的大多数步骤只是常规搜索或状态过渡,少数步骤却决定最终能否成功。AREX 使用高精度规则从最终验证通过的训练轨迹中标出三类关键步骤:

  • 多次探索后,首次通过工具观察获得与答案实体或约束直接相关的证据;
  • 首次否定此前错误候选或假设,并将搜索转向更有效方向;
  • 通过 update_context 保存已验证证据、未解决条件与后续计划的关键更新。

标注依据可验证任务结构和有效工具观察,而不是模型声称“我取得了进展”。训练关键步骤时保留完整前缀,使模型看到正确的轨迹状态,但只对目标步骤的 assistant tokens 计算损失。

全轨迹 mid-training 后,常规步骤的平均 token loss 为 0.232,证据发现、路径否定与重定向、关键上下文更新分别为 0.277、0.298 和 0.300,高出约 19%、28% 和 29%。这说明成功轨迹的平均监督仍会优先拟合大量容易步骤。

在相同监督 token 与优化预算下,用随机步骤回放替代关键步骤监督,BrowseComp 从 82.5 降至 74.1,是训练消融中最大的下降。这个结果有力支持“训练预算应向决策稀疏、价值集中的动作倾斜”,但规则只覆盖三类可高精度识别事件,并不是一般性的 step utility estimator。

3.6 Step-aware RL:按步骤而不是按整条序列分配预算

标准 group-relative policy optimization 通常由最终结果产生一条 trajectory-level advantage,并把它传播给整条生成序列。长程工具轨迹长度不同、步骤角色不同,直接按 token 或整序列聚合会让更长轨迹和更长步骤占据更大权重。

AREX 的处理包括:

  • 先对每个步骤内的 token 概率比取几何平均,得到长度归一的 step-level ratio;
  • 先在轨迹内部平均各步骤,再在 rollout group 内平均各轨迹,避免长轨迹支配目标;
  • 所有步骤保留 group-relative outcome advantage;
  • 只有最终结果有效的轨迹,其已标注关键步骤才获得有界辅助 bonus;
  • 以参考策略 KL penalty 约束更新。

这不是为每一步学习完整 reward model,而是把 mid-training 的高精度关键步骤标注复用为有限 shaping signal。匹配 prompt、rollout 预算、初始化和训练日程时,以标准 GRPO 替代 step-aware RL,BrowseComp 从 82.5 降至 79.4,说明该设计在主要能力形成后贡献了 3.1 个百分点。

4. 推理流程:一次 AREX 研究如何运行

完整流程可以概括为以下状态机:

  1. 从原问题提取当前研究目标;
  2. 内层循环调用 searchvisit,在 HLE 中还可调用 Python;
  3. 证据累积到研究转折点时,模型自主调用 update_context
  4. 内层认为当前目标已充分调查,或继续搜索收益很低时,调用 finish
  5. finish 返回暂定答案、证据和答案级置信度;
  6. 外层高置信接受,低置信则判断轨迹是否可恢复;
  7. 可恢复时把未解决约束变成下一轮定向目标,不可恢复时从原题重启;
  8. 最多执行 5 次外层操作;每次 episode 最多允许 300 个内层 turn;
  9. 若始终未过阈值,返回已完成候选中置信度最高者。

其中,update_context 解决的是一轮之内如何维护可操作状态,外层循环解决的是轮次之间如何依据验证结果继续、重启或停止。二者不能简单视为同一层级的重复组件。

5. 实验结果

5.1 六项 benchmark 的总体表现

模型BrowseCompGAIAxbench-2510DeepSearchQAWideSearch-enHLE(tool)
Qwen3.5-35B61.080.050.368.557.147.4
Qwen3.5-122B63.881.6--60.547.5
Qwen3.5-397B78.683.561.082.174.048.3
DeepSeek-V4-Pro83.4-80.088.778.048.2
Kimi-K2.683.280.690.092.580.854.0*
MiroThinker-H188.288.572.080.6-47.7
AREX-Turbo70.781.657.078.568.540.6
AREX-Base82.585.471.089.982.052.4

* 表示论文表格中该模型使用完整 HLE;无星号结果使用 text-only 子集,因此不能直接横向比较。WideSearch 报 Item-F1,DeepSearchQA 报 F1,其余报告 accuracy。

AREX-Base 的优势主要体现在参数效率和跨任务稳定性:

  • 相比 Qwen3.5-122B backbone,BrowseComp、GAIA、WideSearch-en 和 text-only HLE 分别提高 18.7、3.8、21.5 和 4.9 个百分点;
  • 相比总参数更大的 Qwen3.5-397B,六项已报告指标均更高;
  • WideSearch-en 的 82.0 是表中最高结果;
  • AREX-Turbo 仅 4B,在六项中有五项高于 Qwen3.5-35B,唯一较低的是 HLE。

但“AREX-Base 在所有任务击败 frontier model”并不成立。它在 BrowseComp 低于 MiroThinker-H1、Gemini-3.1-Pro 等,在 xbench-2510 明显低于 Kimi-K2.6,在 DeepSearchQA 低于 Gemini-3.1-Pro 与 Kimi-K2.6。论文也没有报告统一的搜索后端、网页快照、时间窗口、token 与工具预算是否对所有外部结果完全一致;表中部分数字来自其他报告。因此它更适合展示竞争力,而不是严格的等预算排行榜。

5.2 ACU 与外层循环的受控拆分

内层上下文机制外层循环BrowseComp
无 ACU,保留未压缩历史关闭59.6
无 ACU,保留未压缩历史开启69.8
启用 ACU关闭71.4
启用 ACU开启82.5

这组结果提供了论文最直接的因果证据:

  • 单轮匹配条件下,ACU 从 59.6 提高到 71.4,增益 11.8;
  • 无 ACU 时,外层循环带来 10.2;
  • 有 ACU 时,外层循环带来 11.1;
  • 完整系统比两者都关闭高 22.9。

数值近似可加,但不能据此断言二者统计独立;论文没有报告多次运行方差或显著性区间。另一方面,w/o ACU 必须携带未压缩历史,在超长任务中可能同时受到上下文长度与噪声影响,所以消融验证的是“自主状态刷新相对完整历史”的总体效果,并没有区分压缩、结构化字段和自主触发各自贡献。

5.3 置信度可以分离部分正确与错误答案

在最终输出中,无 ACU 时 89.3% 的正确答案、启用 ACU 时 95.9% 的正确答案落在 90–100 置信区间;相对地,无 ACU 时 61.0% 的错误答案、启用 ACU 时 55.2% 的错误答案低于 60。

这说明 self-reported confidence 对外层控制有一定辨别力,但证据仍有限:

  • 论文展示的是分箱分布,没有报告 AUROC、AUPRC、ECE、Brier score 或阈值敏感性;
  • 仍有一部分错误答案获得高置信度;
  • 置信度既决定是否继续,又用于从未过阈值的答案中选最佳,校准误差会直接影响控制流;
  • 未知阈值使外部团队难以复现 accuracy—cost 的权衡。

因此,“置信度支持控制决策”是合理结论,“置信度已经可靠校准”则超出了论文证据。

5.4 训练组件消融

训练设置BrowseComp相对完整系统
渐进式多轮训练改为直接混合训练77.5-5.0
关键步骤监督改为等预算随机步骤回放74.1-8.4
Step-aware RL 改为标准 GRPO79.4-3.1
完整 AREX82.5-

三项组件都产生正贡献,关键步骤监督的影响最大。消融匹配了监督 token/优化预算或 RL rollout/训练日程,设计相对扎实。但它们逐项替换完整系统的一部分,并不是完整 factorial experiment,无法判断组件之间的交互,也没有证明同样排序会出现在 GAIA、WideSearch 或 HLE。

5.5 自蒸馏结果只是初步探索

附录在一个更简单的早期系统中比较 trajectory self-distillation。该设置没有 ACU、外层自改进、关键步骤监督、完整多阶段数据混合和完整测试时扩展。中间 browse-trained agent 为相同问题重新生成轨迹,再用通过筛选的轨迹训练一份从同一 122B-A10B backbone 初始化的新模型,BrowseComp 从直接训练的 52.3 提高到 57.1。

4.8 个百分点说明“更接近目标策略分布的中间模型轨迹”可能比原始轨迹更适合作为监督,但不能与完整系统的 82.5 直接比较,也不能证明自蒸馏加入最终配方仍有增益。作者明确将其保留为未来方向,而不是 AREX-Base 的正式组件。

6. 如何理解这篇论文的真正创新

6.1 自改进的对象是研究状态,不是模型权重

“Recursively Self-Improving”容易让人联想到模型修改自己的参数、代码或训练算法。AREX 实际递归改进的是:

  • 暂定答案;
  • 证据集合;
  • 约束满足状态;
  • 后续研究目标;
  • 有效上下文。

模型权重在单次推理中不发生变化,工具集合、置信阈值、最大轮数和研究环境也由外部预先设定。它是一种 inference-time state refinement,而不是开放式 recursive self-improvement。明确这一区别,才能准确评估安全边界和能力外推范围。

6.2 验证不是奖励终点,而是下一轮问题生成器

传统验证器常用于从多个完整答案中选一个,或判断某一步是否合理。AREX 更有价值的转变是让验证产生新的任务描述:

当前候选的哪些条件已经成立?哪些仍需证据?哪些证据冲突?剩余不确定性如何改写为下一轮搜索目标?

这使系统从“再搜索一次”变为“只围绕未解决约束再研究一次”。如果可验证状态准确,它能减少已经完成部分被重复计算,也能避免用一条总分掩盖局部缺口。

6.3 上下文管理成为策略动作

固定摘要把压缩看成基础设施操作,AREX 把它纳入模型策略:何时压缩、保留什么、下一步做什么都由当前研究进度决定。BrowseComp 中大部分更新远早于 128K 上限,且主要发生在搜索策略改变和候选被排除时,这是其区别于简单 context window 管理的关键证据。

风险也由此产生:update_context 是有损操作。如果模型错误地删除反证、误把猜测标为已验证,后续研究会在一个更短但更偏的状态上运行。论文测试了最终 accuracy,却没有单独测量 state fidelity、citation retention、错误状态恢复率或压缩前后约束召回率。

6.4 关键步骤是长程 agent 训练的稀缺资源

关键步骤在成功轨迹中占少数,却保持更高 loss;对它们定向重放,比等预算随机步骤回放高 8.4 个百分点。这一发现可能比 AREX 的具体双循环更具迁移价值:代码智能体中的首次定位根因、机器人中的首次纠正错误计划、数据分析智能体中的首次发现 schema 不一致,都可能是类似的决策关键点。

当前方法依赖任务可验证性和高精度规则。下一步真正困难的问题,是如何在没有唯一答案、没有结构化约束或外部验证器的开放任务中估计 step utility,同时避免训练模型迎合错误的关键步骤检测器。

7. 局限与审慎解读

7.1 核心训练与数据细节披露不足

论文没有给出以下关键复现信息:

  • 合成任务、教师轨迹和各训练阶段的数据量与混合比例;
  • 使用哪些教师模型、每题采样多少轨迹、质量门通过率;
  • 置信阈值、外层 refine/restart 的提示与判定细节;
  • mid-training 与 RL 的 batch size、学习率、训练步数、group size、KL 系数和关键步骤 bonus;
  • 训练硬件、总 FLOPs、训练时长和失败率。

模型权重、最小推理示例与 BrowseComp 提示词已经开放,能帮助复现部署和部分内层工具行为;公开示例仍把真实工具执行留给调用方,也没有实现论文的完整外层评测编排,因此不足以从 backbone 复现训练结果或一键复现完整系统。

7.2 缺少等成本的推理比较

每个 episode 最多允许 300 个内层 turn 和 5 次外层操作,是很高的上限。论文没有报告平均/中位工具调用数、总输入输出 tokens、网页读取量、端到端时延、搜索 API 成本,以及 Refine 与 Restart 的实际比例。

因此,AREX-Base 用 10B 激活参数取得较好“参数效率”并不自动等于较好“推理成本效率”。一个小模型如果执行更多轮、更长上下文和更多外部搜索,总成本仍可能高于激活参数更多但较快结束的系统。

7.3 核心消融集中在 BrowseComp

ACU、外层循环、训练顺序、关键步骤监督和 step-aware RL 的受控消融都只报告 BrowseComp。这个 benchmark 与论文的多约束网页搜索设计高度匹配,尚不清楚收益能否等幅迁移到:

  • 需要计算工具的 HLE;
  • 强调任务执行的 GAIA;
  • 强调广覆盖的 WideSearch;
  • 证据动态变化、没有唯一答案的真实研究任务。

六项总榜展示了系统整体迁移性,但没有隔离具体组件在其他任务上的贡献。

7.4 Benchmark 口径并不完全统一

WideSearch 使用 Item-F1,DeepSearchQA 使用 F1,其他任务使用 accuracy;HLE 又混合 full 与 text-only 子集。外部模型结果还可能来自不同时间的网页、搜索后端和报告。论文对 * 做了标注,这是必要的透明度,但读者不应把每一列数字都理解为同一评测环境中的严格 head-to-head。

7.5 自报告置信度可能形成错误反馈

外层循环依赖模型自己的答案级置信度。若模型系统性过度自信,它会过早接受缺少证据的答案;若系统性低估,则会浪费更多工具调用或在已有正确答案后继续修改。论文显示正确/错误输出的置信区间有分离,却没有提供独立 verifier、校准算法或对抗性误校准实验。

7.6 Web 证据与自动验证有天然边界

合成任务要求联合约束唯一确定答案且每项都有可用证据,这有利于自动验证,却可能偏向“事实存在且答案封闭”的问题。现实研究常遇到来源互相引用、页面更新、付费墙、模糊定义、价值判断和多个合理答案。验证器在这些任务中可能把争议错误地压成单一状态。

8. 应用影响

8.1 企业研究与竞争情报

AREX 适合把复杂调研拆成明确约束,例如公司、时间、产品规格、监管状态和可信来源要求。系统可以保留已确认事实,围绕缺口进行定向搜索,并记录排除候选的理由。生产落地仍应增加来源白名单、时间戳、审计日志和人工审批。

8.2 科学文献综述

文献综述天然包含多项约束:研究对象、方法、数据集、样本规模、结论方向和发表时间。improvement state 可以把“已验证论文—相互冲突结论—未覆盖子问题”变成结构化研究计划。论文训练数据包含科学文献任务,但没有单列科学综述 benchmark,因此这一用途仍主要是机制推断。

8.3 调查式问答与合规核查

逐约束验证可用于政策适用性、供应商资质、产品认证和尽职调查。相比一次生成完整答案,系统能明确暴露未满足条件。高风险场景不能依赖 self-reported confidence 单独停止,仍需独立规则、权威数据库和人工复核。

8.4 通用智能体的记忆与恢复

update_context 的设计可迁移到编码、运维和数据分析智能体:状态中同时保存已验证进展、失败路径、开放问题和下一步计划。尤其值得借鉴的是保存负面证据,因为只保留成功发现的摘要会让智能体不断重试已证伪方案。

8.5 长轨迹训练数据的预算配置

关键步骤监督表明,成功轨迹不是均质训练资源。团队可先分析逐步 loss 和任务结构,再把有限训练预算集中到证据突破、根因定位、计划纠正和状态刷新等动作,而不是无限扩充大量例行工具调用。

9. 与相关工作的关系

路线代表工作AREX 的位置
工具增强推理ReAct、Toolformer、WebGPT从单轨迹的推理—行动循环扩展到验证驱动的多轮研究
Deep Research 训练Search-R1、WebDancer、WebSailor、Tongyi DeepResearch不只增加工具轨迹和推理时预算,还显式决定轮次间 Refine/Restart
验证与过程监督Let’s Verify Step by Step、Math-Shepherd、step-level reward modeling把验证从答案排序或局部评分提升为下一轮目标生成机制
长程记忆MemGPT、分层 memory、定期摘要、memory action由模型在语义转折点自主产生面向约束的 improvement state
长程 agent RLGRPO、turn-level credit assignment按步骤做长度归一和层级平均,并为成功轨迹中的关键步骤塑形
推理时扩展retry、best-of-N、长轨迹搜索在保留进展的 Refine 与清空污染状态的 Restart 之间动态选择

AREX 不是凭空创造搜索、验证、记忆或 step-aware credit assignment,而是把这些路线组织成一个闭环。其最清晰的差异是:验证结果必须改变后续研究问题和有效上下文,而不只是改变一个分数。

10. 结论

AREX 提出了一种比“让智能体继续搜索”更结构化的 Deep Research 扩展方式。它利用发现—验证不对称,把暂定答案逐项审计为部分验证状态,再将未解决约束改写成下一轮目标;自主上下文更新保存证据、反证、候选与计划;关键步骤监督和 step-aware RL 则试图解决长轨迹中训练信号被常规步骤稀释的问题。

实证中最可信的结论来自 BrowseComp 受控实验:ACU 在单轮设置贡献 11.8 个百分点,外层循环在 ACU 存在时再贡献 11.1,关键步骤监督相对等预算随机步骤回放贡献 8.4。AREX-Base 在六类任务上也表现稳定,尤其 WideSearch-en 达到表中最高的 82.0,4B Turbo 则显示小模型也能从 agentic 训练中获得明显收益。

但论文标题中的“自改进”应限定为推理时研究状态递归,不应外推为权重或系统自主进化。训练数据与超参数未充分披露,核心机制只在 BrowseComp 消融,跨模型评测口径与推理成本也不统一。下一步最值得关注的不是单纯把最大轮数继续增加,而是公开 accuracy—cost 曲线、测量上下文更新的状态保真度、引入独立置信校准,并在动态、开放、无唯一答案的真实研究任务中验证这一闭环。

参考资料

  1. AREX Team. AREX: Towards a Recursively Self-Improving Agent for Deep Research. arXiv:2607.21461, 2026.
  2. Hugging Face. AREX Daily Papers 详情页.
  3. BAAI. AREX 项目页.
  4. VectorSpaceLab. AREX 开源仓库.
  5. BAAI. AREX-Base 模型页.
  6. BAAI. AREX-Turbo 模型页.
  7. Yao et al. ReAct: Synergizing Reasoning and Acting in Language Models. 2022.
  8. Schick et al. Toolformer: Language Models Can Teach Themselves to Use Tools. 2023.
  9. Nakano et al. WebGPT: Browser-assisted Question-answering with Human Feedback. 2021.
  10. Lightman et al. Let’s Verify Step by Step. 2023.
  11. Wang et al. Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations. 2023.
  12. Packer et al. MemGPT: Towards LLMs as Operating Systems. 2023.