AREX
基于 Hugging Face Daily Papers 2026-07-24 榜首论文,深入解读 AREX 如何把约束级验证变成研究轮次之间的控制信号,并结合自主上下文更新、关键步骤监督与长程强化学习构建递归自改进的深度研究智能体。
自动研究时间:2026-07-25 09:01(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Jul 24,列表最顶部为 AREX;详情页标注#1 Paper of the day。
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> 20 页 arXiv PDF 与完整 HTML -> 项目页、代码仓库和 Hugging Face 模型页交叉核对。
执行摘要
许多 Deep Research 系统把“投入更多推理预算”近似等同于“沿一条轨迹搜索更久”。问题在于,延长轨迹并不保证研究持续进步:早期错误可能被带入后续推理,已经排除的候选会被重复访问,部分满足约束的答案也可能被过早接受。AREX 的出发点是发现—验证不对称性:在巨大搜索空间中发现一个同时满足多项约束的答案很难,但给定候选后,逐项检查时间、数值、实体关系、技术属性和证据要求,往往容易得多。
论文据此把验证从“答案生成后的最后一道过滤器”升级为“研究轮次之间的状态转移”。内层研究循环负责搜索、浏览、整合证据并给出暂定答案;外层自改进循环逐项审计约束,根据答案级置信度选择接受、带着有效进展继续细化,或放弃被污染的轨迹后重新开始。每轮留下的不是一段泛化摘要,而是由模型自主生成的 improvement state:已验证发现及来源、当前与已排除候选、未解决约束、有效性风险和下一步计划。
AREX 还把这一推理结构延伸到训练。作者先合成具有唯一答案、可验证约束和多跳难度的研究任务,再筛选强教师模型产生的工具调用轨迹;随后依次训练浏览、多轮工具使用、专家推理和混合能力,并对“首次发现决定性证据”“否定错误方向并转向”“关键上下文更新”等高价值步骤额外施加监督。强化学习阶段采用按步骤归一的策略目标,并只在最终成功的轨迹中给予关键步骤有限奖励,避免长轨迹和常规步骤淹没真正决定成败的动作。
结果显示,122B 总参数、每 token 激活 10B 参数的 AREX-Base 在 BrowseComp、GAIA、xbench-2510、DeepSearchQA、WideSearch-en 和 HLE(text-only)上分别取得 82.5、85.4、71.0、89.9、82.0 和 52.4。最有解释力的不是跨模型总榜,而是同一系统内的 BrowseComp 消融:自主上下文更新带来 11.8 个百分点,外层循环在启用自主更新时再带来 11.1 个百分点,两者都关闭的 59.6 与完整系统的 82.5 相差 22.9 个百分点。
不过,“递归自改进”在本文中是受固定工具、置信阈值和最多五次外循环约束的测试时改进,不是模型自主修改权重、训练代码或目标函数。论文没有披露训练数据规模、教师模型、置信阈值、主要训练超参数、训练计算量、推理 token/时延/工具成本,也只在 BrowseComp 上做核心机制消融。更准确的评价是:AREX 为长程研究智能体提供了一个有实证支撑的“验证—状态压缩—定向再研究”闭环,但尚未证明它在等成本条件下普遍优于其他推理扩展策略。
1. 论文基本信息
| 项目 | 内容 |
|---|---|
| 论文标题 | AREX: Towards a Recursively Self-Improving Agent for Deep Research |
| 论文编号 | arXiv:2607.21461 |
| arXiv 版本 | v1,2026-07-23 提交 |
| Hugging Face 状态 | 2026-07-24 Daily Papers 榜首,#1 Paper of the day |
| 作者 | Shuqi Lu、Chaofan Li、Kun Luo、Zhang Zhang 等 24 位作者 |
| 研究机构 | Beijing Academy of Artificial Intelligence(BAAI) |
| 学科分类 | Artificial Intelligence(cs.AI) |
| 模型版本 | AREX-Turbo:Qwen3.5-4B 稠密模型;AREX-Base:Qwen3.5-122B-A10B MoE |
| 推理接口 | search、visit、update_context、finish;HLE 额外提供 Python |
| 论文规模 | 20 页,5 张表,附相关工作与简化设置下的自蒸馏探索 |
| 开放资源 | 两个模型权重、最小推理示例与 BrowseComp 完整提示词;模型采用 Apache-2.0 |
核心链接:
- Hugging Face 论文页:https://huggingface.co/papers/2607.21461
- arXiv 摘要页:https://arxiv.org/abs/2607.21461
- arXiv 完整 HTML:https://arxiv.org/html/2607.21461
- arXiv PDF:https://arxiv.org/pdf/2607.21461
- 项目页:https://vectorspacelab.github.io/arex-model/
- 开源仓库:https://github.com/VectorSpaceLab/arex-model
- 模型集合:https://huggingface.co/collections/BAAI/arex
- AREX-Base:https://huggingface.co/BAAI/AREX-Base
- AREX-Turbo:https://huggingface.co/BAAI/AREX-Turbo
2. 背景与动机:为什么“搜索更久”不等于“研究更深”
2.1 多约束问题的难点在于联合满足
Deep Research 的目标通常不是找到一个包含关键词的网页,而是构造一个同时满足多项条件的答案。例如,候选必须满足特定时间范围、数值关系、实体关联、技术特征与来源要求。单个条件可能容易检索,但它们的交集在搜索空间中很稀疏。
沿单一轨迹不断追加搜索和推理,会出现三类结构性问题:
- 错误继承:早期误判成为后续查询的前提,更多搜索反而围绕错误候选积累材料;
- 进度丢失:上下文截断或泛化摘要丢掉来源、反证和“为什么排除某候选”,导致重复探索;
- 停止失准:系统缺少对每项约束的显式状态,只能凭整体感觉决定继续或结束。
AREX 认为,既然候选已经给定,验证往往可以拆成更容易处理的逐约束检查。验证结果不只给出“对或错”,还产生一个可操作的中间状态:哪些主张已有可靠证据,哪些仍然缺失,哪些证据互相冲突,下一轮应该查什么。
2.2 现有三条路线之间缺少闭环
论文将既有工作概括为三类:
- 工具增强与推理时扩展让智能体沿轨迹搜索、阅读和推理更久;
- outcome ranking、process supervision 或 critic 使用验证来筛选答案、评价局部动作;
- 长上下文、分层记忆、固定摘要和显式 memory action 管理持续增长的历史。
这些能力各自有用,但如果验证只是末端打分、记忆只是按 token 阈值压缩,系统仍不知道如何把“部分验证的答案”转换为“下一轮更窄、更有效的研究问题”。AREX 的核心设计正是连接这三者:验证产生状态,状态驱动压缩,压缩后的未解决约束驱动下一轮工具使用。
3. 核心贡献
3.1 把验证定义为研究轮次的转换算子
AREX 的关键概念不是多一层循环本身,而是外层循环如何决定状态转移。内层 finish 输出三个对象:
- 面向原始问题的暂定答案;
- 支持答案的证据及文档标识;
- 综合完整性、一致性、来源可追溯性和时间有效性的答案级置信度。
外层根据置信阈值采取三种动作:
| 动作 | 触发条件 | 状态处理 |
|---|---|---|
| Accept | 置信度超过阈值 | 返回当前答案 |
| Refine | 置信度不足,但轨迹包含可复用进展 | 保留可靠发现,把未解决问题改写为定向目标 |
| Restart | 轨迹噪声大、误导性强或缺乏有效信息 | 丢弃轨迹,从原问题重新研究 |
这一区分很重要。简单 retry 会把每轮都当成独立抽样,简单 continue 又会把所有旧错误继续带入;AREX 尝试在二者之间选择“保留哪些进展”。如果达到最大轮数仍没有答案越过阈值,系统返回已完成答案中置信度最高的一个。
3.2 自主上下文更新不是普通摘要
长程工具调用会积累搜索结果、冲突证据、失败查询、旧计划与被排除候选。固定截断按位置删除内容,固定 token 阈值摘要只解决长度问题,却不一定在研究发生转折时更新。
AREX 提供显式的 update_context 工具,由当前模型自主判断何时调用。更新后的 improvement state 保留:
- 已验证发现与来源标识;
- 当前仍有可能的候选;
- 未解决约束;
- 来源、时效或一致性方面的有效性风险;
- 已排除候选及其反证;
- 下一步研究计划。
冗余观察、被新证据推翻的结论和过时计划则被删除。调用后,模型基于刷新后的状态继续,而不再携带更新之前的完整轨迹。它可以一轮调用多次,也可以完全不调用;只有触及 128K active context 上限时才被强制更新。
BrowseComp 行为统计说明它主要是语义动作,而不是长度保险:
| 指标 | 结果 |
|---|---|
至少调用一次 update_context 的样本 | 80.3% |
| 调用时平均 active context | 25,721 tokens |
| 调用时中位 active context | 25,386 tokens |
| 在 128K 上限附近触发的更新 | 0.01% |
| 因修改搜索策略触发 | 66.9% |
| 因排除候选触发 | 13.6% |
| 更新中保留未解决约束 | 95.5% |
| 更新中保留下一步计划 | 96.4% |
| 更新中保留已排除候选 | 81.5% |
平均调用点远低于硬上限,支持作者关于“模型在研究转折点主动刷新状态”的解释。不过,这些 trigger 与 content 类别如何自动标注、分类误差多大,论文没有详细给出。
3.3 可验证的递归研究任务与教师轨迹
训练任务覆盖三类场景:
- 浏览密集型:跨多个来源检索和整合;
- 推理密集型:多步规划、演绎和假设比较;
- 科学文献型:跨论文综合学术证据。
人类专家先定义答案格式、可用来源、推理要求和验证标准。系统再从网页、论文、结构化知识库和公共代码仓库中选择潜在答案,提取一组可验证约束,并把约束改写为需要多跳搜索的间接描述。
一个任务只有同时满足以下条件才被保留:
- 不能直接从题面推断答案;
- 每项约束都有可获得证据;
- 联合约束唯一确定答案;
- 自动检查通过正确性、唯一性、证据可用性和难度门槛;
- 独立 research rollout 不能用浅层检索轻易解决,也不能在充分探索后仍不可解。
强教师模型随后在与 AREX 相同的工具环境中生成包含分析、工具调用、观察和结构化答案的完整轨迹。质量门会删除直接猜答案、不根据观察修正、工具调用无效、引用不可靠、答案无法由已收集证据重建,以及答案级置信度低于阈值的轨迹。
这套管线的价值在于把训练目标从“模仿最终文本”扩展为“模仿研究过程”。但论文没有披露任务数量、三类数据占比、教师模型身份、通过率和人工抽检一致性,因此外部读者无法判断数据规模与质量门各自贡献了多少。
3.4 渐进式 agentic mid-training
作者认为,把工具调用、网页导航、专家推理、文献研究和答案综合从一开始混在同一分布中,容易产生能力干扰。训练因此分为三个相连阶段:
- 浏览能力建立:先学习多轮搜索、网页阅读、证据获取、查询改写和答案综合;
- 专家推理强化:再引入长链思考、多步推理、假设验证和困难问题求解;
- 混合能力巩固:加入复杂论文研究和知识密集任务,同时选择性回放浏览轨迹中的关键步骤,恢复可能被推理训练削弱的工具使用。
匹配总体训练预算的消融中,把渐进式训练替换为从头混合训练,BrowseComp 从 82.5 降至 77.5,差 5.0 个百分点。这支持“训练顺序可减少异质能力干扰”,但目前仅在单一 benchmark、单一模型配方上得到验证。
3.5 关键步骤监督:把损失集中到真正困难的决策
长轨迹的大多数步骤只是常规搜索或状态过渡,少数步骤却决定最终能否成功。AREX 使用高精度规则从最终验证通过的训练轨迹中标出三类关键步骤:
- 多次探索后,首次通过工具观察获得与答案实体或约束直接相关的证据;
- 首次否定此前错误候选或假设,并将搜索转向更有效方向;
- 通过
update_context保存已验证证据、未解决条件与后续计划的关键更新。
标注依据可验证任务结构和有效工具观察,而不是模型声称“我取得了进展”。训练关键步骤时保留完整前缀,使模型看到正确的轨迹状态,但只对目标步骤的 assistant tokens 计算损失。
全轨迹 mid-training 后,常规步骤的平均 token loss 为 0.232,证据发现、路径否定与重定向、关键上下文更新分别为 0.277、0.298 和 0.300,高出约 19%、28% 和 29%。这说明成功轨迹的平均监督仍会优先拟合大量容易步骤。
在相同监督 token 与优化预算下,用随机步骤回放替代关键步骤监督,BrowseComp 从 82.5 降至 74.1,是训练消融中最大的下降。这个结果有力支持“训练预算应向决策稀疏、价值集中的动作倾斜”,但规则只覆盖三类可高精度识别事件,并不是一般性的 step utility estimator。
3.6 Step-aware RL:按步骤而不是按整条序列分配预算
标准 group-relative policy optimization 通常由最终结果产生一条 trajectory-level advantage,并把它传播给整条生成序列。长程工具轨迹长度不同、步骤角色不同,直接按 token 或整序列聚合会让更长轨迹和更长步骤占据更大权重。
AREX 的处理包括:
- 先对每个步骤内的 token 概率比取几何平均,得到长度归一的 step-level ratio;
- 先在轨迹内部平均各步骤,再在 rollout group 内平均各轨迹,避免长轨迹支配目标;
- 所有步骤保留 group-relative outcome advantage;
- 只有最终结果有效的轨迹,其已标注关键步骤才获得有界辅助 bonus;
- 以参考策略 KL penalty 约束更新。
这不是为每一步学习完整 reward model,而是把 mid-training 的高精度关键步骤标注复用为有限 shaping signal。匹配 prompt、rollout 预算、初始化和训练日程时,以标准 GRPO 替代 step-aware RL,BrowseComp 从 82.5 降至 79.4,说明该设计在主要能力形成后贡献了 3.1 个百分点。
4. 推理流程:一次 AREX 研究如何运行
完整流程可以概括为以下状态机:
- 从原问题提取当前研究目标;
- 内层循环调用
search、visit,在 HLE 中还可调用 Python; - 证据累积到研究转折点时,模型自主调用
update_context; - 内层认为当前目标已充分调查,或继续搜索收益很低时,调用
finish; finish返回暂定答案、证据和答案级置信度;- 外层高置信接受,低置信则判断轨迹是否可恢复;
- 可恢复时把未解决约束变成下一轮定向目标,不可恢复时从原题重启;
- 最多执行 5 次外层操作;每次 episode 最多允许 300 个内层 turn;
- 若始终未过阈值,返回已完成候选中置信度最高者。
其中,update_context 解决的是一轮之内如何维护可操作状态,外层循环解决的是轮次之间如何依据验证结果继续、重启或停止。二者不能简单视为同一层级的重复组件。
5. 实验结果
5.1 六项 benchmark 的总体表现
| 模型 | BrowseComp | GAIA | xbench-2510 | DeepSearchQA | WideSearch-en | HLE(tool) |
|---|---|---|---|---|---|---|
| Qwen3.5-35B | 61.0 | 80.0 | 50.3 | 68.5 | 57.1 | 47.4 |
| Qwen3.5-122B | 63.8 | 81.6 | - | - | 60.5 | 47.5 |
| Qwen3.5-397B | 78.6 | 83.5 | 61.0 | 82.1 | 74.0 | 48.3 |
| DeepSeek-V4-Pro | 83.4 | - | 80.0 | 88.7 | 78.0 | 48.2 |
| Kimi-K2.6 | 83.2 | 80.6 | 90.0 | 92.5 | 80.8 | 54.0* |
| MiroThinker-H1 | 88.2 | 88.5 | 72.0 | 80.6 | - | 47.7 |
| AREX-Turbo | 70.7 | 81.6 | 57.0 | 78.5 | 68.5 | 40.6 |
| AREX-Base | 82.5 | 85.4 | 71.0 | 89.9 | 82.0 | 52.4 |
* 表示论文表格中该模型使用完整 HLE;无星号结果使用 text-only 子集,因此不能直接横向比较。WideSearch 报 Item-F1,DeepSearchQA 报 F1,其余报告 accuracy。
AREX-Base 的优势主要体现在参数效率和跨任务稳定性:
- 相比 Qwen3.5-122B backbone,BrowseComp、GAIA、WideSearch-en 和 text-only HLE 分别提高 18.7、3.8、21.5 和 4.9 个百分点;
- 相比总参数更大的 Qwen3.5-397B,六项已报告指标均更高;
- WideSearch-en 的 82.0 是表中最高结果;
- AREX-Turbo 仅 4B,在六项中有五项高于 Qwen3.5-35B,唯一较低的是 HLE。
但“AREX-Base 在所有任务击败 frontier model”并不成立。它在 BrowseComp 低于 MiroThinker-H1、Gemini-3.1-Pro 等,在 xbench-2510 明显低于 Kimi-K2.6,在 DeepSearchQA 低于 Gemini-3.1-Pro 与 Kimi-K2.6。论文也没有报告统一的搜索后端、网页快照、时间窗口、token 与工具预算是否对所有外部结果完全一致;表中部分数字来自其他报告。因此它更适合展示竞争力,而不是严格的等预算排行榜。
5.2 ACU 与外层循环的受控拆分
| 内层上下文机制 | 外层循环 | BrowseComp |
|---|---|---|
| 无 ACU,保留未压缩历史 | 关闭 | 59.6 |
| 无 ACU,保留未压缩历史 | 开启 | 69.8 |
| 启用 ACU | 关闭 | 71.4 |
| 启用 ACU | 开启 | 82.5 |
这组结果提供了论文最直接的因果证据:
- 单轮匹配条件下,ACU 从 59.6 提高到 71.4,增益 11.8;
- 无 ACU 时,外层循环带来 10.2;
- 有 ACU 时,外层循环带来 11.1;
- 完整系统比两者都关闭高 22.9。
数值近似可加,但不能据此断言二者统计独立;论文没有报告多次运行方差或显著性区间。另一方面,w/o ACU 必须携带未压缩历史,在超长任务中可能同时受到上下文长度与噪声影响,所以消融验证的是“自主状态刷新相对完整历史”的总体效果,并没有区分压缩、结构化字段和自主触发各自贡献。
5.3 置信度可以分离部分正确与错误答案
在最终输出中,无 ACU 时 89.3% 的正确答案、启用 ACU 时 95.9% 的正确答案落在 90–100 置信区间;相对地,无 ACU 时 61.0% 的错误答案、启用 ACU 时 55.2% 的错误答案低于 60。
这说明 self-reported confidence 对外层控制有一定辨别力,但证据仍有限:
- 论文展示的是分箱分布,没有报告 AUROC、AUPRC、ECE、Brier score 或阈值敏感性;
- 仍有一部分错误答案获得高置信度;
- 置信度既决定是否继续,又用于从未过阈值的答案中选最佳,校准误差会直接影响控制流;
- 未知阈值使外部团队难以复现 accuracy—cost 的权衡。
因此,“置信度支持控制决策”是合理结论,“置信度已经可靠校准”则超出了论文证据。
5.4 训练组件消融
| 训练设置 | BrowseComp | 相对完整系统 |
|---|---|---|
| 渐进式多轮训练改为直接混合训练 | 77.5 | -5.0 |
| 关键步骤监督改为等预算随机步骤回放 | 74.1 | -8.4 |
| Step-aware RL 改为标准 GRPO | 79.4 | -3.1 |
| 完整 AREX | 82.5 | - |
三项组件都产生正贡献,关键步骤监督的影响最大。消融匹配了监督 token/优化预算或 RL rollout/训练日程,设计相对扎实。但它们逐项替换完整系统的一部分,并不是完整 factorial experiment,无法判断组件之间的交互,也没有证明同样排序会出现在 GAIA、WideSearch 或 HLE。
5.5 自蒸馏结果只是初步探索
附录在一个更简单的早期系统中比较 trajectory self-distillation。该设置没有 ACU、外层自改进、关键步骤监督、完整多阶段数据混合和完整测试时扩展。中间 browse-trained agent 为相同问题重新生成轨迹,再用通过筛选的轨迹训练一份从同一 122B-A10B backbone 初始化的新模型,BrowseComp 从直接训练的 52.3 提高到 57.1。
4.8 个百分点说明“更接近目标策略分布的中间模型轨迹”可能比原始轨迹更适合作为监督,但不能与完整系统的 82.5 直接比较,也不能证明自蒸馏加入最终配方仍有增益。作者明确将其保留为未来方向,而不是 AREX-Base 的正式组件。
6. 如何理解这篇论文的真正创新
6.1 自改进的对象是研究状态,不是模型权重
“Recursively Self-Improving”容易让人联想到模型修改自己的参数、代码或训练算法。AREX 实际递归改进的是:
- 暂定答案;
- 证据集合;
- 约束满足状态;
- 后续研究目标;
- 有效上下文。
模型权重在单次推理中不发生变化,工具集合、置信阈值、最大轮数和研究环境也由外部预先设定。它是一种 inference-time state refinement,而不是开放式 recursive self-improvement。明确这一区别,才能准确评估安全边界和能力外推范围。
6.2 验证不是奖励终点,而是下一轮问题生成器
传统验证器常用于从多个完整答案中选一个,或判断某一步是否合理。AREX 更有价值的转变是让验证产生新的任务描述:
当前候选的哪些条件已经成立?哪些仍需证据?哪些证据冲突?剩余不确定性如何改写为下一轮搜索目标?
这使系统从“再搜索一次”变为“只围绕未解决约束再研究一次”。如果可验证状态准确,它能减少已经完成部分被重复计算,也能避免用一条总分掩盖局部缺口。
6.3 上下文管理成为策略动作
固定摘要把压缩看成基础设施操作,AREX 把它纳入模型策略:何时压缩、保留什么、下一步做什么都由当前研究进度决定。BrowseComp 中大部分更新远早于 128K 上限,且主要发生在搜索策略改变和候选被排除时,这是其区别于简单 context window 管理的关键证据。
风险也由此产生:update_context 是有损操作。如果模型错误地删除反证、误把猜测标为已验证,后续研究会在一个更短但更偏的状态上运行。论文测试了最终 accuracy,却没有单独测量 state fidelity、citation retention、错误状态恢复率或压缩前后约束召回率。
6.4 关键步骤是长程 agent 训练的稀缺资源
关键步骤在成功轨迹中占少数,却保持更高 loss;对它们定向重放,比等预算随机步骤回放高 8.4 个百分点。这一发现可能比 AREX 的具体双循环更具迁移价值:代码智能体中的首次定位根因、机器人中的首次纠正错误计划、数据分析智能体中的首次发现 schema 不一致,都可能是类似的决策关键点。
当前方法依赖任务可验证性和高精度规则。下一步真正困难的问题,是如何在没有唯一答案、没有结构化约束或外部验证器的开放任务中估计 step utility,同时避免训练模型迎合错误的关键步骤检测器。
7. 局限与审慎解读
7.1 核心训练与数据细节披露不足
论文没有给出以下关键复现信息:
- 合成任务、教师轨迹和各训练阶段的数据量与混合比例;
- 使用哪些教师模型、每题采样多少轨迹、质量门通过率;
- 置信阈值、外层 refine/restart 的提示与判定细节;
- mid-training 与 RL 的 batch size、学习率、训练步数、group size、KL 系数和关键步骤 bonus;
- 训练硬件、总 FLOPs、训练时长和失败率。
模型权重、最小推理示例与 BrowseComp 提示词已经开放,能帮助复现部署和部分内层工具行为;公开示例仍把真实工具执行留给调用方,也没有实现论文的完整外层评测编排,因此不足以从 backbone 复现训练结果或一键复现完整系统。
7.2 缺少等成本的推理比较
每个 episode 最多允许 300 个内层 turn 和 5 次外层操作,是很高的上限。论文没有报告平均/中位工具调用数、总输入输出 tokens、网页读取量、端到端时延、搜索 API 成本,以及 Refine 与 Restart 的实际比例。
因此,AREX-Base 用 10B 激活参数取得较好“参数效率”并不自动等于较好“推理成本效率”。一个小模型如果执行更多轮、更长上下文和更多外部搜索,总成本仍可能高于激活参数更多但较快结束的系统。
7.3 核心消融集中在 BrowseComp
ACU、外层循环、训练顺序、关键步骤监督和 step-aware RL 的受控消融都只报告 BrowseComp。这个 benchmark 与论文的多约束网页搜索设计高度匹配,尚不清楚收益能否等幅迁移到:
- 需要计算工具的 HLE;
- 强调任务执行的 GAIA;
- 强调广覆盖的 WideSearch;
- 证据动态变化、没有唯一答案的真实研究任务。
六项总榜展示了系统整体迁移性,但没有隔离具体组件在其他任务上的贡献。
7.4 Benchmark 口径并不完全统一
WideSearch 使用 Item-F1,DeepSearchQA 使用 F1,其他任务使用 accuracy;HLE 又混合 full 与 text-only 子集。外部模型结果还可能来自不同时间的网页、搜索后端和报告。论文对 * 做了标注,这是必要的透明度,但读者不应把每一列数字都理解为同一评测环境中的严格 head-to-head。
7.5 自报告置信度可能形成错误反馈
外层循环依赖模型自己的答案级置信度。若模型系统性过度自信,它会过早接受缺少证据的答案;若系统性低估,则会浪费更多工具调用或在已有正确答案后继续修改。论文显示正确/错误输出的置信区间有分离,却没有提供独立 verifier、校准算法或对抗性误校准实验。
7.6 Web 证据与自动验证有天然边界
合成任务要求联合约束唯一确定答案且每项都有可用证据,这有利于自动验证,却可能偏向“事实存在且答案封闭”的问题。现实研究常遇到来源互相引用、页面更新、付费墙、模糊定义、价值判断和多个合理答案。验证器在这些任务中可能把争议错误地压成单一状态。
8. 应用影响
8.1 企业研究与竞争情报
AREX 适合把复杂调研拆成明确约束,例如公司、时间、产品规格、监管状态和可信来源要求。系统可以保留已确认事实,围绕缺口进行定向搜索,并记录排除候选的理由。生产落地仍应增加来源白名单、时间戳、审计日志和人工审批。
8.2 科学文献综述
文献综述天然包含多项约束:研究对象、方法、数据集、样本规模、结论方向和发表时间。improvement state 可以把“已验证论文—相互冲突结论—未覆盖子问题”变成结构化研究计划。论文训练数据包含科学文献任务,但没有单列科学综述 benchmark,因此这一用途仍主要是机制推断。
8.3 调查式问答与合规核查
逐约束验证可用于政策适用性、供应商资质、产品认证和尽职调查。相比一次生成完整答案,系统能明确暴露未满足条件。高风险场景不能依赖 self-reported confidence 单独停止,仍需独立规则、权威数据库和人工复核。
8.4 通用智能体的记忆与恢复
update_context 的设计可迁移到编码、运维和数据分析智能体:状态中同时保存已验证进展、失败路径、开放问题和下一步计划。尤其值得借鉴的是保存负面证据,因为只保留成功发现的摘要会让智能体不断重试已证伪方案。
8.5 长轨迹训练数据的预算配置
关键步骤监督表明,成功轨迹不是均质训练资源。团队可先分析逐步 loss 和任务结构,再把有限训练预算集中到证据突破、根因定位、计划纠正和状态刷新等动作,而不是无限扩充大量例行工具调用。
9. 与相关工作的关系
| 路线 | 代表工作 | AREX 的位置 |
|---|---|---|
| 工具增强推理 | ReAct、Toolformer、WebGPT | 从单轨迹的推理—行动循环扩展到验证驱动的多轮研究 |
| Deep Research 训练 | Search-R1、WebDancer、WebSailor、Tongyi DeepResearch | 不只增加工具轨迹和推理时预算,还显式决定轮次间 Refine/Restart |
| 验证与过程监督 | Let’s Verify Step by Step、Math-Shepherd、step-level reward modeling | 把验证从答案排序或局部评分提升为下一轮目标生成机制 |
| 长程记忆 | MemGPT、分层 memory、定期摘要、memory action | 由模型在语义转折点自主产生面向约束的 improvement state |
| 长程 agent RL | GRPO、turn-level credit assignment | 按步骤做长度归一和层级平均,并为成功轨迹中的关键步骤塑形 |
| 推理时扩展 | retry、best-of-N、长轨迹搜索 | 在保留进展的 Refine 与清空污染状态的 Restart 之间动态选择 |
AREX 不是凭空创造搜索、验证、记忆或 step-aware credit assignment,而是把这些路线组织成一个闭环。其最清晰的差异是:验证结果必须改变后续研究问题和有效上下文,而不只是改变一个分数。
10. 结论
AREX 提出了一种比“让智能体继续搜索”更结构化的 Deep Research 扩展方式。它利用发现—验证不对称,把暂定答案逐项审计为部分验证状态,再将未解决约束改写成下一轮目标;自主上下文更新保存证据、反证、候选与计划;关键步骤监督和 step-aware RL 则试图解决长轨迹中训练信号被常规步骤稀释的问题。
实证中最可信的结论来自 BrowseComp 受控实验:ACU 在单轮设置贡献 11.8 个百分点,外层循环在 ACU 存在时再贡献 11.1,关键步骤监督相对等预算随机步骤回放贡献 8.4。AREX-Base 在六类任务上也表现稳定,尤其 WideSearch-en 达到表中最高的 82.0,4B Turbo 则显示小模型也能从 agentic 训练中获得明显收益。
但论文标题中的“自改进”应限定为推理时研究状态递归,不应外推为权重或系统自主进化。训练数据与超参数未充分披露,核心机制只在 BrowseComp 消融,跨模型评测口径与推理成本也不统一。下一步最值得关注的不是单纯把最大轮数继续增加,而是公开 accuracy—cost 曲线、测量上下文更新的状态保真度、引入独立置信校准,并在动态、开放、无唯一答案的真实研究任务中验证这一闭环。
参考资料
- AREX Team. AREX: Towards a Recursively Self-Improving Agent for Deep Research. arXiv:2607.21461, 2026.
- Hugging Face. AREX Daily Papers 详情页.
- BAAI. AREX 项目页.
- VectorSpaceLab. AREX 开源仓库.
- BAAI. AREX-Base 模型页.
- BAAI. AREX-Turbo 模型页.
- Yao et al. ReAct: Synergizing Reasoning and Acting in Language Models. 2022.
- Schick et al. Toolformer: Language Models Can Teach Themselves to Use Tools. 2023.
- Nakano et al. WebGPT: Browser-assisted Question-answering with Human Feedback. 2021.
- Lightman et al. Let’s Verify Step by Step. 2023.
- Wang et al. Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations. 2023.
- Packer et al. MemGPT: Towards LLMs as Operating Systems. 2023.