本页目录 Bilevel Coordinated Reflection

Bilevel Coordinated Reflection

深入解析 Bilevel Coordinated Reflection 如何用双层博弈刻画多智能体分工,以环境验证器筛选反思记忆,并从收敛条件、SWE-bench 结果、评测边界与工程落地审视 SRMA 的价值。

自动研究时间:2026-09-08 09:02(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Sep 7,列表最顶部为 Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> arXiv HTML 与 9 页 PDF 全文 -> 官方代码仓库。

执行摘要

多智能体 LLM 系统通常有两条直觉:把复杂任务拆给多个 worker,应该比一个模型独自处理更稳;让智能体在失败后写下反思并加入记忆,下一轮应该会更好。Bilevel Coordinated Reflection 的价值,是把这两条直觉改写成一组可检验、有适用条件的命题。

论文先把 orchestrator–worker 架构建模为双层协调博弈。上层 orchestrator 选择任务分解,下层 worker 各自优化局部目标;worker 之间因共享变量、接口和约束而存在耦合。若单条耦合强度不超过 κ\kappa、每个 worker 最多与 dmaxd_{\max} 个邻居耦合,下层是一个误差不超过 ηc2dmaxκ\eta_c\le 2d_{\max}\kappa 的近似势博弈。直观上,任务切得越干净,局部改进越可能同时改善全局结果;接口纠缠越多,worker 即使各自“做对”也只能收敛到更松的近似均衡。

论文的第二个结论更重要:反思不是天然的优化步骤,写入记忆才是一次有风险的状态更新。 无条件写入会同时积累纠错信息与幻觉。单侧漂移条件只能给出期望误差上界 νˉ/γ\bar\nu/\underline\gamma,并不能证明所有自由反思过程都一定停在正误差地板;要得到正下界,还必须验证“有害内容持续注入”这一额外条件。作者进一步构造两个文本生成规律完全相同、但同一段反思在真实环境中意义相反的环境,证明任何只看 transcript 的 gate 都不可能在两者上统一改进。模型更大、提示词更长或让另一个 LLM 当裁判,都不能补回 transcript 中不存在的环境信息。

由此得到 Stochastic Reflective Memory Ascent(SRMA):先生成候选反思,但只有当固定的环境验证协议确认候选记忆使 verifier risk 严格下降时,才提交写入。若验证器校准、有效候选的概率不退化且每次接受能按比例减少风险,SRMA 可单调收敛到零风险;有效候选概率不随当前风险衰减时为几何速率,随 RβR^\beta 衰减时为多项式速率。论文还用置信区间 gate 处理随机评测,并通过重新评估当前记忆来适应分段平稳环境。

实验覆盖隐藏资源上限博弈、Overcooked 和 500 个 SWE-bench 实例。最醒目的 Kimi K2.5 结果是:同骨干、匹配预算下,Bilevel SRMA 的解决率为 72.2%,自由写入反思的多智能体版本为 58.4%;但论文列出的 70.8% mini-SWE-agent 是外部公开榜单参考,并非同一次受控实验。DeepSeek 受控对照则从单 worker 的 68.2% 提升到 Bilevel SRMA 的 71.4%。因此,证据有力支持“外部验证的写入门控优于无门控反思”,却还不足以单独量化双层分解、共享记忆、额外 worker 与 SRMA 各自贡献,也没有证明开放世界中的不完备测试能保障真实效用单调提升。

1. 论文基本信息

项目内容
论文标题Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems
论文编号arXiv:2609.02750
当前版本v1,2026-09-02 提交,9 页
作者Yihang Chen、Yuxiang Chen、Yuxuan Huang、Meng Fang、Weilin Luo、Jun Wang
机构UCL Centre for Artificial Intelligence、University of Liverpool、Huawei
主分类Artificial Intelligence(cs.AI)
核心方法双层协调博弈、双记忆随机漂移、SRMA
受控环境Resource Contest、Overcooked
端到端评测SWE-bench,500 个实例
使用模型MiniMax-M2.7;DeepSeek;Kimi K2.5
代码状态已公开 RC 与 Overcooked;抓取时 README 表示 SWE-bench 将另行开放

核心链接:

2. 背景与动机:多智能体系统缺少什么理论

2.1 从流程图到可分析对象

AutoGen、MetaGPT 等系统已经形成常见模式:orchestrator 拆解问题,worker 分头执行,通过消息和共享 workboard 协调,再把批评、经验与失败原因写入外部记忆。现有工作往往描述“谁与谁通信”“何时调用工具”“哪个 buffer 被更新”,却很少回答三个更基础的问题:

  1. orchestrator 的分解质量怎样限制 worker 最终能协调到什么程度;
  2. 为什么自由反思有时持续改善,有时会停滞甚至污染后续轨迹;
  3. 为什么测试、模拟器或形式化检查器能提供文本 critic 无法替代的信号。

这三个问题分别对应博弈结构、记忆状态转移和信息可辨识性。论文的统一视角是:任务分解决定局部行动之间的耦合,反思决定外部记忆怎样随机移动,而验证器决定系统能否知道这次移动在真实环境里是好是坏。

2.2 冻结模型为何仍能“学习”

文中的 LLM 权重始终冻结,系统的适应通道是非参数记忆:

  • execution memory mem_e:worker 共享的工作记录、环境证据和执行经验,在较快时间尺度上更新;
  • strategy memory mom_o:orchestrator 用于选择分解与协作策略的经验,在较慢时间尺度上跨 episode 更新。

因此,“反思学习”并不是参数优化,而是对未来上下文的编辑。候选反思一旦写入,就会改变后续采样分布;错误反思也会以同样机制影响下一轮。把 memory commit 视为需要验证的状态变更,是 SRMA 与普通 self-reflection 的根本差别。

3. 核心贡献

3.1 用耦合强度量化分解质量

论文把系统效用写成局部效用与两两耦合之和:

U(x)=i=1Nui(xiτi)+(i,j)Eψij(xi,xjτi,τj).U(x)=\sum_{i=1}^{N}u_i(x_i\mid\tau_i)+\sum_{(i,j)\in\mathcal E}\psi_{ij}(x_i,x_j\mid\tau_i,\tau_j).

τi\tau_i 是分配给 worker ii 的子任务,ψij\psi_{ij} 表示两个局部解之间的接口、共享变量或联合约束。若 ψijκ|\psi_{ij}|\le\kappa,任一 worker 最多有 dmaxd_{\max} 个耦合邻居,则 worker 的局部收益变化与全局势函数变化最多相差:

ηc2dmaxκ.\eta_c\le 2d_{\max}\kappa.

在有限行动集合中,反复执行幅度超过 ηc\eta_c 的 better response 会有限步终止于 ηc\eta_c-近似纯策略 Nash 均衡。更实用的解释是:好的 task decomposition 不只是让 prompt 更短,还要同时降低依赖边数 dmaxd_{\max} 与单条依赖强度 κ\kappa。如果两个 worker 频繁写同一文件、共同决定同一接口或各自假设对方的输出格式,仅增加 agent 数量不会自动改善结果。

论文还给出 orchestrator 的下界权衡。令可达到的局部效用为 Jloc(τ)J_{\mathrm{loc}}(\tau)、耦合代价为 C(τ)=dmax(τ)κ(τ)C(\tau)=d_{\max}(\tau)\kappa(\tau),则均衡处的全局效用满足:

E[U(x(τ))]Jloc(τ)52NC(τ).\mathbb E[U(x^*(\tau))]\ge J_{\mathrm{loc}}(\tau)-\frac{5}{2}NC(\tau).

这提醒系统设计者:拆成更多容易完成的子任务可能提高 JlocJ_{\mathrm{loc}},也可能制造更多跨任务接口、放大 C(τ)C(\tau);分解粒度存在真实取舍。

3.2 澄清自由反思的误差地板

作者以 Vt[0,1]V_t\in[0,1] 表示当前记忆造成的次优程度。自由反思每轮无条件写入,若满足:

E[Vt+1Ft](1γt)Vt+νt,\mathbb E[V_{t+1}\mid\mathcal F_t]\le(1-\gamma_t)V_t+\nu_t,

其中 γtVt\gamma_tV_t 是纠错漂移,νt\nu_t 是无依据内容带来的平均残余误差负荷,则在 γtγ>0\gamma_t\ge\underline\gamma>0νtνˉ\nu_t\le\bar\nu 时:

E[VT](1γ)TV0+νˉγ(1(1γ)T).\mathbb E[V_T]\le(1-\underline\gamma)^T V_0+\frac{\bar\nu}{\underline\gamma}\left(1-(1-\underline\gamma)^T\right).

这个式子给的是最坏上界。论文特意纠正一种常见过度解读:νˉ/γ\bar\nu/\underline\gamma 并不意味着每个自由反思过程都必然停在那里。只有再观测到持续有害写入,即存在反方向的下漂移约束,才能推出正的普适误差下界。上下约束都成立时,长期误差才被夹在一个 two-sided error tube 中。这使理论可以被日志数据证伪,而不是把“反思会幻觉”写成不可检验的口号。

3.3 证明文本自评存在信息论边界

论文构造环境 ε+\varepsilon^+ε\varepsilon^-:两边产生候选反思的文本分布完全相同,但两类反思 C0C_0C1C_1 的真实语义作用互换。同一段文本在一个环境中纠错,在另一个环境中有害。只观察生成文本及自身随机性的 gate,在两个环境里必然采取同样的接受序列,因而不可能同时改善两边。

该结论覆盖任意容量、可随机、依赖完整历史的 text-only gate,也包括理想化的 LLM-as-judge。它不是说文本自评永远无用:如果 transcript 自身包含完整正确性证书,例如可逐步检查的证明,文本足以区分好坏;但当真值依赖隐藏资源上限、API 返回、模拟器状态、实际仓库测试或外部世界时,judge 的推理能力不能替代缺失的观测。

3.4 提出带验证写入门控的 SRMA

SRMA 固定一套 evaluation protocol gig_i 与环境验证器 V\mathcal V,把记忆 mem_e 映射为风险:

Ri(me)=ρ ⁣(V(gi(τi,me),τi)).R_i(m_e)=\rho\!\left(\mathcal V(g_i(\tau_i,m_e),\tau_i)\right).

每轮流程为:

  1. 用当前记忆执行固定评估协议,得到当前风险 RtR_t 与环境诊断;
  2. LLM 根据任务、输出、诊断和现有记忆提出候选反思;
  3. 把候选暂时合入记忆,用同一协议重新评估;
  4. 仅在候选风险严格低于当前风险时提交,否则保留旧记忆。

关键不是“先让 LLM 自评一次”,而是当前与候选状态必须在同一固定、可比较且依赖环境的协议下评估。对随机得分,论文使用 Hoeffding 置信半径:候选风险的上置信界必须低于当前风险的下置信界才接受,从而在总失败概率 tδt\sum_t\delta_t 内保证所有被接受更新都降低真实期望验证风险。

3.5 给出条件化的精确收敛与速率

若有效候选的接受概率满足 ptc1Rtβp_t\ge c_1R_t^\beta,每次接受平均至少消去 c2Rtc_2R_t,则 c=c1c2c=c_1c_2 时:

E[Rt+1Ft]RtcRt1+β.\mathbb E[R_{t+1}\mid\mathcal F_t]\le R_t-cR_t^{1+\beta}.
  • β=0\beta=0:有效候选概率不会随逼近最优而消失,期望风险以 (1c)T(1-c)^T 几何衰减;
  • β(0,1]\beta\in(0,1]:越接近最优越难提出可接受改进,风险以 (R0β+cβT)1/β\left(R_0^{-\beta}+c\beta T\right)^{-1/\beta} 多项式衰减。

作者还给出匹配构造,说明几何速率和多项式指数在常数因子意义下是紧的。若环境在有限次数发生变化,只要重新用当前环境评估旧记忆与候选记忆,最终平稳区间仍可重新套用收敛结论;但这只是逐区间保证,不是一般性的 switching-regret 上界。

4. 实验设计

4.1 Resource Contest:验证隐藏信息与漂移

Resource Contest 是隐藏容量分配问题。worker 通过环境反馈探测各自未知上限,orchestrator 决定资源分配。easy、hard、many 分别改变上限间距和 worker 数量,drift 则在第 10 轮更换最优 worker,用来测试旧记忆过时后的重新锚定。

它的优势是环境最优值已知,累积 reward 与 regret 都可直接计算,不需要 LLM 裁判。其局限也很明显:状态空间和奖励结构是人为设计的,离开放式工具使用还有很远距离。

4.2 Overcooked:验证协作、gate 质量与漂移定律

Overcooked 使用两个 agent、200 步 horizon 和三种布局:狭小空间中的互相阻塞、非对称角色分工,以及共享锅具争用。验证器是精确 BFS value table,风险定义为从当前状态到下一次交付所需的最少联合动作步数。

实验按相同交互和模型调用预算比较 greedy、无记忆、自由反思、文本自评与 grounded SRMA,并单独记录有益/有害候选的接受率。作者还从 412 个 gate event 中以三个完整 seed 校准参数,保留两个完整 trajectory 检验理论预测,避免把同一路径的相邻状态随机拆到训练和测试中。

4.3 SWE-bench:端到端软件修复

完整系统在全部 500 个 SWE-bench 实例上运行。每个 episode 包含两个 mini-SWE-agent v2 worker,共享仓库与 workboard,最多协调三轮,最后提交评分最高的 patch;官方 repository test harness 充当 grounded verifier。

需要区分三类对照:

  • DeepSeek 下的单 worker 与 Bilevel SRMA 是匹配预算的受控对照;
  • Kimi K2.5 下的自由反思多智能体与 Bilevel SRMA 是匹配骨干和预算的 gate 消融;
  • Kimi K2.5 的 70.8% mini-SWE-agent 是公开 leaderboard 外部参考,不是同一实验中的受控基线。

5. 核心实验结果

5.1 Resource Contest

设置Oracle 累积奖励ε\varepsilon-greedy无记忆SRMA
easy120113.1±3.0113.1\pm3.0115.0±5.2115.0\pm5.2118.4±2.2118.4\pm2.2
hard160157.4±1.1157.4\pm1.1158.0±2.3158.0\pm2.3159.2±0.9159.2\pm0.9
many180170.9±4.0170.9\pm4.0174.0±3.7174.0\pm3.7177.3±1.9177.3\pm1.9

SRMA 达到 oracle reward 的 98.5%–99.5%。执行记忆平均增加 2.6 个 reward point,并把平均 regret 从 4.33 降到 1.70,降幅 60.8%。这支持共享记忆能把分散在各 worker 手里的环境证据转化为 orchestrator 可用的协调信息。

5.2 Overcooked

布局Greedy无记忆自由反思文本自评Grounded SRMA
cramped_room120±40120\pm40180±40180\pm40240±60240\pm60280±40280\pm40320±20320\pm20
asymmetric_advantages80±4080\pm40140±40140\pm40180±40180\pm40220±40220\pm40280±20280\pm20
centre_pots40±040\pm0100±40100\pm40160±60160\pm60200±40200\pm40260±20260\pm20

Grounded SRMA 在三个布局都最好,相对文本 self-gate 分别提高 14.3%、27.3% 和 30.0%。更直接的 gate 分析显示:

方法接受有害候选接受有益候选最终风险
自由反思100.0%100.0\%100.0%100.0\%0.42±0.120.42\pm0.12
文本 self-gate34.5±4.2%34.5\pm4.2\%72.8±5.1%72.8\pm5.1\%0.28±0.080.28\pm0.08
Grounded SRMA6.2±1.8%6.2\pm1.8\%85.4±3.6%85.4\pm3.6\%0.14±0.030.14\pm0.03

SRMA 仍接受了 6.2% 被独立 oracle 判为有害的候选。这不违反其自身风险单调性,而是说明实际 gate verifier 与 oracle task risk 并非完美校准:验证器认为更好的记忆,仍可能伤害真正关心的下游指标。这一差距正是从理论保证走向生产系统时最需要监控的量。

漂移拟合得到 β^=0.52±0.04\hat\beta=0.52\pm0.04,据此预测风险约按 O(T1.92)\mathcal O(T^{-1.92}) 衰减;预测在两个 held-out trajectory 上达到 Pearson r=0.94r=0.94、RMSE 0.032。这是对速率形状的机制级支持,但只有五个 seed、两个测试 trajectory,不能视作广泛跨环境定律。

随机验证器方面,单次采样会错误接受 28.4±5.2%28.4\pm5.2\% 的恶化候选;固定五次 probe 把它降到 6.8±1.5%6.8\pm1.5\%,代价是 225 次 verifier 调用。自适应置信 gate 以 82±1482\pm14 次调用达到相近的 7.1±1.8%7.1\pm1.8\%,调用量减少 63.6%。结果说明 grounding 解决“有没有外部信息”,置信控制解决“有限采样能否看清差异”,两者并非同一问题。

在容量于第 10 轮变化的 drift 环境中,re-anchored gate 平均 1.2 轮检测变化、2.5 轮切换到新最优,变更后 regret 为 12.6;保留陈旧锚点的 grounded gate 分别为 2.4、7.8 和 38.2,text-only gate 在 20 轮内未检测到变化。外部验证可以发现世界变了,但只有重新评估旧记忆,系统才不会拿新环境继续维护过期经验。

5.3 SWE-bench

系统骨干模型解决率对照性质
mini-SWE v2DeepSeek68.2%受控、匹配预算
Bilevel SRMADeepSeek71.4%受控、匹配预算
Free-form MAKimi K2.558.4%受控、匹配骨干与预算
mini-SWE v2(public)Kimi K2.570.8%外部榜单参考
Bilevel SRMAKimi K2.572.2%完整系统

Kimi 对照中,grounded gate 相对自由反思多智能体高 13.8 个百分点,是全文最强的端到端消融。它也揭示一个反直觉风险:多 agent 加自由反思并非“至少不差”,58.4% 反而显著低于单 agent 的公开 70.8% 参考。共享记忆会放大有用发现,也会传播错误假设;只有受控写入才能把协作变成稳定增益。

72.2% 与 70.8% 的 1.4 个百分点差距不能当作严格受控的算法提升,因为后者来自外部榜单;论文没有提供两套系统在同一 500 实例上的逐题配对差异、置信区间或显著性检验。更可信的受控证据是 DeepSeek 的 3.2 个百分点提升,以及 Kimi 下 SRMA 相对 free-form MA 的大幅改善。

6. 局限与批判性分析

6.1 理论保证依赖强条件

有限行动集、弱耦合、验证器校准、非退化纠错概率和按比例风险下降,在受控游戏里可以直接构造,在开放式 Agent 任务中却未必成立。软件修复的候选 patch 近乎无限,任务分解也会动态变化;测试套件不完整时,零测试风险不等于零真实缺陷。此时 SRMA 能保证的是观察到的 verifier risk,而不是用户效用、代码质量或安全性。

6.2 “不可能性”结论有清楚但有限的作用域

文本 gate 定理是针对 text-indistinguishable environments 的 minimax 结果。现实任务里 transcript 往往含有部分证据,LLM judge 可能有用;结论不支持“所有 LLM-as-judge 都无效”。它真正排除的是更强主张:当真实差异没有进入文本观测时,不能指望仅靠更强的文本模型统一解决。

6.3 实验规模仍偏小

Resource Contest 和 Overcooked 的均值与标准差来自五个 seed。漂移速率只有三个校准 trajectory 与两个 held-out trajectory。论文展示了清晰趋势,却没有跨模型、跨验证噪声、跨任务分布的大规模重复。参数 c1,c2,βc_1,c_2,\beta 在未观察状态上是否保持,也没有实证证书。

6.4 计算与 token 成本未完整报告

双 worker、最多三轮协调、候选记忆的重复执行与 verifier probing 都会增加模型和环境调用。论文报告匹配预算对照,却没有给出每个已解决实例的 token、墙钟时间或费用,也没有将 3.2 个百分点的 DeepSeek 增益换算成成本效率。实际部署必须把 gate 精度与 probe 成本一起优化,并设计何时停止反思。

6.5 复现材料尚不完整

官方仓库公开了 Resource Contest、Overcooked、memory、orchestrator 和测试代码,README 说明所有模型经 OpenAI-compatible endpoint 调用,也给出复现实验命令。但抓取时仓库明确表示 SWE-bench 场景将另行开放,论文最重要的端到端结果尚不能依靠当前公开代码完整复现。

7. 应用与工程影响

7.1 软件工程智能体

代码任务天然适合 grounded reflection:编译器、测试、类型检查、静态分析、benchmark 与安全扫描都可提供环境信号。可将候选经验先放入隔离分支或临时 memory,运行固定评估后再决定是否写入长期项目记忆。需要避免把单一测试通过率当作完备目标,可组合回归测试、隐藏测试、lint、安全规则和变更规模约束形成多维 gate。

7.2 机器人与模拟决策

模拟器状态、碰撞检测、任务完成度和能耗都比自然语言自评更接近真实反馈。SRMA 适合让策略记忆先在 simulator 或 digital twin 中试运行,再进入在线控制。但 simulation-to-real gap 会表现为 verifier–oracle miscalibration,仍需真实世界校准与安全边界。

7.3 企业工作流与工具调用

API 状态码、数据库约束、业务规则引擎和审计结果可以充当 grounded verifier。系统可以把“反思建议”与“生效配置”分离:候选只进入 staging,经回放历史请求或 shadow traffic 验证后提交。对退款、合规、财务和权限变更等高风险流程,严格下降规则还应加入不可违反的硬约束,而不是只优化平均风险。

7.4 多智能体编排设计

论文给出两个可操作指标:用 dmaxκd_{\max}\kappa 监控分解耦合,用有益/有害候选的接受率监控 memory gate。工程上可据此采取:

  • 按所有权边界拆任务,尽量减少多个 worker 同时修改同一状态;
  • 为跨 worker 接口提供机器可检查 schema,而不只用自然语言约定;
  • 候选记忆先暂存,验证通过后原子提交;
  • 每轮重新评估基线,防止环境变化后继续保护旧最优;
  • 分开记录 verifier risk 与真正业务指标,持续测量校准误差;
  • 当边际改善低于 verifier 调用与 token 成本时终止反思。

8. 相关工作与定位

研究方向代表工作本文的推进
多智能体编排AutoGen、MetaGPT、Agyn从通信流程推进到含分解耦合误差的双层博弈
自我反思Reflexion、Self-Refine区分自由写入的上界、紧性与需额外条件才能成立的正误差下界
LLM 自评LLM-as-judge、self-evaluation给出文本不可区分环境下的统一改进不可能性
势博弈exact/approximate potential games2dmaxκ2d_{\max}\kappa 连接 worker 耦合与近似均衡松弛量
随机逼近与漂移Foster–Lyapunov、multiplicative/variable drift推导 SRMA 的几何或多项式收敛率及紧性
Agent 软件修复SWE-bench、mini-SWE-agent用 repository test harness 作为反思记忆的 grounded gate

与 Reflexion 的差异不在于“是否写经验”,而在于经验能否通过环境证据再进入记忆;与普通 best-of-nn 的差异则在于 SRMA 更新的是跨轮次生效的记忆状态,并研究其长期风险轨迹。它也不同于训练期 RL:模型参数冻结,改善来自受控的 test-time memory editing。

9. 结论

Bilevel Coordinated Reflection 最值得保留的观点可以压缩成一句话:多智能体系统的关键不是生成更多意见,而是减少任务耦合,并让每次长期记忆写入接受真实环境的检验。

论文把分解、协调、反思、验证与环境漂移放进同一理论框架,尤其严谨地区分了自由反思误差上界与必然误差地板,并说明 text-only critic 的边界来自信息缺失而非单纯模型能力。SRMA 的实验结果也一致支持 grounded gate:Overcooked 中最终风险较文本 gate 减半,Kimi K2.5 的 SWE-bench 受控消融比自由反思高 13.8 个百分点。

但“严格下降”只有相对于所选择的 verifier 才成立。测试不完备、目标错配、开放行动空间、模型调用成本和当前缺失的 SWE-bench 复现代码,都限制了结论外推。对实际系统而言,SRMA 更像一个架构原则而不是即插即用保证:设计可区分环境的评测信号,校准它与真实效用的关系,把反思作为候选补丁而非直接事实,并持续重估旧记忆是否仍适合当前世界。

参考资料

  1. Chen, Y. et al. Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems, arXiv:2609.02750, 2026.
  2. Hugging Face. Paper detail: arXiv 2609.02750.
  3. Chen, Y. et al. Bilevel Coordinated Reflection official implementation.
  4. Wu, Q. et al. AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation, 2023.
  5. Hong, S. et al. MetaGPT: Meta Programming for Multi-Agent Collaborative Framework, 2023.
  6. Shinn, N. et al. Reflexion: Language Agents with Verbal Reinforcement Learning, 2023.
  7. Madaan, A. et al. Self-Refine: Iterative Refinement with Self-Feedback, 2023.
  8. Jimenez, C. E. et al. SWE-bench: Can Language Models Resolve Real-World GitHub Issues?, 2023.