本页目录 Raven

Raven

Raven 将模型与工具、记忆和执行策略组成可组合的智能单元,以宿主代理编排异构专家,并通过可演化 harness、长期记忆与技能复用扩展复杂任务覆盖范围。

论文基本信息

  • 题目:Raven: The Harness of Harnesses for Composable Agentic Intelligence
  • 机构:EverMind AI
  • arXiv:2609.33439v1,2026 年 9 月 27 日提交,类别 cs.AI
  • Daily Papers:2026 年 9 月 30 日榜首
  • 链接:Hugging Face;arXiv 摘要;arXiv 全文

一句话结论

Raven 的关键不是再造一个“全能代理”,而是把每个模型与其 harness 视为可调用、可验证、可组合的能力单元,再由 Host Agent 将异构专家编译成带依赖关系的执行图;这使系统能力从单代理性能问题转化为接口、编排、记忆和演化的系统工程问题。

背景与动机

模型本身并不等于代理能力。工具接口、上下文管理、技能、恢复策略和执行环境共同形成 harness,同一模型在不同 harness 下可能表现得像不同的执行者。长程跨领域任务又天然需要研究、编码、设计和持续运维等不同专长。现有方案通常面临两难:通用 harness 难以在每个领域做到精细,专用 harness 则因接口和假设不同而难以协作。

论文因此把问题改写为三个问题:如何自动构造领域 harness,如何从失败经验中改进它,以及如何在共享预算内可靠组合多个 harness。这个视角比“让多个代理聊天”更严格,因为它要求显式描述产物、依赖、成本和完成条件。

核心贡献

  1. 提出开放的多代理生态:原生的 Raven-Research、Raven-Code、Raven-Design、Raven-Oncall 与 Claude Code、Codex 等第三方代理通过适配器接入统一执行接口。
  2. 给出可组合智能的形式化定义:能力是在共同资源预算与失败概率阈值下可靠完成某类任务的覆盖集合;论文推导了互补局部能力、兼容交接和有界规划/执行误差带来超越任一单代理覆盖范围的充分条件。
  3. 将 harness 自演化、长期记忆和 Skill Forge 纳入同一闭环,使失败诊断可以变成策略修改,执行轨迹可以变成以后可检索的经验与程序。
  4. 发布 MAOB 编排基准,并从规划、领域执行、harness 演化和技能复用多个层次评测系统,而非只报告最终任务分数。

方法:从请求到可执行协作图

Host Agent 与 DAG

Host Agent 读取异构代理注册表,把目标拆为节点,并用有向无环图表达产物依赖。节点不仅包含代理名称,还包含输入、输出、完成标准和绑定产物。运行时先验证图,再调度依赖已满足的节点;失败时进入异常处理或向用户请求澄清,最终由明确的综合节点合并结果。

这种设计的价值是把协作从隐式对话变为可审计的工作流:边表示信息交接,调度器可以识别并行机会,运行报告则记录资源与产物。文件化节点记录只向下游传播必要上下文,降低把全量历史塞给每个代理造成的污染和成本。

Harness 自演化

Raven 将 harness 看成包围冻结模型的可变策略层。演化器根据失败轨迹定位问题,从 Harness Gene Bank 检索和重组候选策略,再以成对实验和门控筛选确认改动是否真正改善目标指标。由于任务模型保持冻结,实验更能区分收益来自模型能力还是执行策略。

记忆与 Skill Forge

记忆系统先形成带来源的 episodic trace,再压缩为语义事实,检索时按关联关系重建上下文。Host archive 保存用户与任务上下文,可选 EverOS 支持跨会话经验复用。Skill Forge 则把经验转成可执行程序,并从本地技能、记忆技能和 SkillHub 中进行任务感知检索。其底层 SkillCorpus 固定快照含 96,401 个有效技能,通过指纹与语义去重、质量评分、安全门控后才进入检索库。

实验与结果

编排能力

MAOB 包含 140 个任务,覆盖 137 种职业和全部 11 种二至四领域组合;参考图平均 2.72 个节点、1.84 条边,其中 42 个任务允许并行。指标分别衡量专家选择(Node F1)、依赖预测(Edge F1)、偏序正确性和整图完全匹配。Raven 在两种测试 backbone 的四项指标上均居首,整图 Exact Match 相对最强基线分别提高 10.4 和 10.5 个百分点。

专业执行

论文还分别评估四个原生专家。一个可复核的例子是 PresentBench:Raven-Design 在 Claude Opus 5 下得 80.2 分、在 GPT-5.6 Luna 下得 72.9 分,对应 Claude Code 为 78.3 和 52.4。视觉任务的六种“基准×模型”组合中 Raven-Design 均为最高分,但相对最强替代方案多数只领先 0.3–2.8 分,说明专用工作流有效,却不应把所有提升都解读成数量级突破。

研究、编码与 on-call 结果共同支持“合适 harness 可释放同一 backbone 的更多能力”,但各部分使用的基准、裁判和成本口径并不完全一致。论文将 MAOB 规划评测与各专家终端任务评测分开是合理的,也意味着不能用单一总分概括整套系统。

局限与审慎解读

  • 理论给出的是充分条件,不证明现实系统必然满足接口兼容、误差独立或预算约束;“组合后更强”仍取决于 Host 是否能正确规划和验证。
  • MAOB 的参考图先由 Claude Opus 5 生成,再由 GLM-5.2 反向生成请求。尽管有泄漏过滤与专家复核,参考分解并不一定唯一,也可能带入构造模型偏好。
  • 多组结果依赖内部评估器或不同公开榜单,跨表直接比较不可靠;设计案例也只有七个精选样例,没有人类偏好实验。
  • 系统增加了编排调用、记忆检索、验证和修复成本。论文形式化考虑共享预算,但实际部署仍需衡量额外延迟、费用和故障面。
  • 自演化 harness 和可复用技能可能积累错误或恶意指令。论文提供安全门控与来源记录,但长期在线演化的漂移、权限隔离和回滚仍是开放问题。

应用影响

Raven 最适合无法由单一工具链端到端完成的工作:跨仓库软件交付、研究到可视化报告、需要持续监控的运维任务,以及组织内多个专用代理的统一调度。对平台建设者而言,最值得复用的不是具体代理名单,而是四个接口原则:能力注册表、类型化产物、显式依赖、可验证完成条件。

它也提示了代理生态的潜在分工:基础模型提供通用推理,harness 厂商沉淀领域执行策略,技能市场提供程序性知识,Host 层负责组合与治理。若标准化接口成熟,提升系统能力不再只依赖替换更大模型,也可通过更好的任务路由、记忆和策略演化获得。

相关工作

Raven 处在四条研究线的交汇处。多代理编排方面与 AutoGen 等角色协作系统相关,但更强调 DAG、类型化交接和运行时验证;代理自动设计方面承接 AgentSquare,并直接复用团队此前 HarnessBank 的语义基因库与门控验证;长期记忆方面与 MemGPT、Zep、MIRIX 等系统相邻;技能获取方面建立在 SkillCorpus 上,并与 Voyager 式可复用技能思想一致。它的差异化主张,是将这些模块整合为“模型—harness 对”可组合、可演化的开放执行生态。

总结

Raven 把代理系统的竞争焦点从单个 prompt 或模型转向完整运行时:谁来拆任务、产物如何交接、失败怎样归因、经验如何复用,以及改动如何验证。论文的系统覆盖面和实验广度令人印象深刻,MAOB 也让编排质量获得了独立测量;不过其理论条件与工程实现之间仍有距离,内部评测和精选案例需要更多第三方复现。最稳妥的结论是:在复杂长程任务中,harness 的模块化、可验证组合已经成为与模型能力同等重要的扩展轴。

参考资料

  1. Hugging Face Daily Papers:Raven
  2. arXiv:Raven
  3. Raven 项目仓库
  4. HarnessBank
  5. SkillCorpus