本页目录 MerchantBench

MerchantBench

基于 Hugging Face Daily Papers 2026-08-05 榜首论文,深入解读 MerchantBench 如何用 365 天订单级电商仿真、真实需求轨迹、异步风险反馈与 26 项工具评测智能体的长期一致性,并审视其人类差距、框架效应、复现边界与部署启示。

自动研究时间:2026-08-06 09:01(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Aug 5,列表最顶部为 MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations;详情页标注 #1 Paper of the day
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv v2 摘要页 -> arXiv 完整 PDF、HTML 全文与 TeX 源码(含全部附录)-> 官方代码仓库与数据开放说明。

执行摘要

多数智能体基准考察的是一次性任务:打开网页、调用几个工具、找到答案,成功与失败很快就能判定。真实运营却不是这种结构。一个电商商家今天选品、定价和接单,可能立即占用现金,却要数天后才知道供应商是否延迟、客户是否退款、差评是否拖累整店流量;与此同时,季节需求还在持续变化。智能体不仅要“做对一步”,还要在数百次决策后继续记得目标、追踪旧决策的后果,并依据新证据修正策略。

Alibaba Group、浙江大学、北京大学与复旦大学的研究者提出 MerchantBench,把这种能力称为 Long-Term Coherence(长期一致性)。基准让智能体经营一家 1688 代发模式的虚拟店铺,控制期覆盖 365 个模拟日、8,760 个小时,每 12 小时开放一次决策窗口。环境以 98,843 条真实商品记录、36,576 家供应商和一年需求轨迹为基础,暴露 26 项商家工具,并把供应商价格变化、下架、发货延迟等快速反馈,与取消、退款、退货、差评等延迟订单结果连接起来。

作者在 ReAct 与 Hermes 两种框架下评估 8 个大模型,每个模型—框架组合重复 3 次,共 48 次全年运行。最好的组合是 Hermes + Qwen3.7-Max,平均期末净资产为 5.946 万元;三名人类参与者的平均值为 21.761 万元,前者只有后者的 27.3%。Hermes 跨模型平均比 ReAct 获得高 53.3% 的期末净资产,但效果高度依赖模型;最高均值配置本身的变异系数达到 55.1%。这说明“换一个更强脚手架”有明显价值,却没有消除不稳定性。

论文最重要的发现不是排行榜,而是把长期失败拆成两类:操作一致性丢失时,智能体逐渐少行动、缩窄控制回路,甚至提前放弃;策略一致性丢失时,智能体虽然仍在行动,却偏离期末净资产目标,或不能让策略更新与累积证据相匹配。个别错误还会被摘要和记忆固化为长期政策,例如错误地相信减少商品会把流量集中到剩余商品,最终把货架从 47 个在售品缩到 3 个。

MerchantBench 因此是一项很有价值的系统级评测:它把“长期”从 token 数或步骤数,推进到具有现金约束、部分可观测、非平稳需求和延迟后果的闭环经营。但结论仍需谨慎:每个配置只有 3 次运行,人类基线也只有 3 名无电商经验者;真实业务数据不随代码开放,公开仓库默认使用 1,000 商品、200 供应商的合成场景;两种框架的内置记忆、代码执行与技能系统并不等价;仿真也远未覆盖真实商家的广告、竞争、库存、客服和合规问题。它更适合作为长期智能体的压力测试与诊断工具,而不是现实经营能力的直接证明。

1. 论文基本信息

项目内容
论文标题MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations
论文编号arXiv:2607.28956
arXiv 版本v1 于 2026-07-31 提交;当前 v2 于 2026-08-04 修订
Hugging Face 状态2026-08-05 Daily Papers 榜首,#1 Paper of the day
作者Qiming Shi、Yulong Tao、Linbo Jin、Zhaolu Kang、Yibo Dou、Jiawen Zhu、Tianjun Pan、Shaokang Fu、Chengyu Wang、Siyue Li、Yaping Cheng、Di Weng、Chengfu Huo
机构Alibaba Group;浙江大学 CAD&CG 国家重点实验室、软件学院;北京大学软件与微电子学院;复旦大学计算机科学技术学院
学科分类Artificial Intelligence(cs.AI)
研究对象长期智能体评测、工具调用、电商经营、延迟反馈适应、非平稳决策
环境规模365 个模拟日、8,760 个小时、每 12 小时一个决策窗口、26 项工具
数据规模98,843 个商品、36,576 家供应商、10 个一级类目、365 天需求与市场报告
实验规模8 个 LLM × 2 个智能体框架 × 3 次重复 = 48 次 LLM 运行

核心链接:

2. 背景与动机:为什么“运行很久”不等于“具备长期能力”

2.1 传统评测把长期问题切碎了

工具调用、网页操作和软件控制基准通常给出一个边界清晰的目标。智能体执行若干动作,环境很快返回成功或失败。这类任务能测试局部规划和接口使用,却弱化了真实部署中的四个难点:

  1. 状态持久化:今天的动作会改变明天的可选项;
  2. 反馈延迟:收益、退款、处罚或声誉变化可能晚很多步才出现;
  3. 环境非平稳:高需求商品、供应状态与机会集合随时间变化;
  4. 目标持续性:没有人每一步都重新提醒智能体“继续经营并最大化最终资产”。

因此,一个智能体即使能连续运行一年,也可能只是在重复局部反应。论文用一句值得记住的判断概括这一点:long-running 不必然意味着 long-horizon。真正的长期能力要求当前决策能与早期证据、未来目标和变化中的环境保持连贯。

2.2 为什么选择卖家侧电商

卖家经营天然把多个控制回路耦合到一起:

  • 选品决定未来需求机会与供应风险;
  • 定价同时影响利润空间与订单到达率;
  • 新订单马上占用采购现金,收入却在履约后才结算;
  • 某个商品的退款或差评会降低整店评分,进而影响整个商品组合的需求;
  • 季节变化要求持续替换商品,而不是年初一次性选出固定货架。

这使电商环境比单纯的库存补货或静态商品经营更适合观察“旧动作—延迟证据—新策略”的闭环。

2.3 论文对长期一致性的操作化定义

MerchantBench 不是直接给 Long-Term Coherence 一个单一分数,而是把它分成两层:

层次核心问题典型失败
操作一致性(Operational Coherence)智能体是否在整个周期持续介入、跟进旧决策和处理新事件活跃度衰减、控制回路缩窄、过早放弃
策略一致性(Strategic Coherence)行动是否持续服务最终目标,并根据累积证据校准策略目标漂移、对延迟证据反应不足、错误假设被记忆固化

这个拆分很有用:不行动当然会失败,但行动频繁也不代表策略正确。长期评测必须同时看“有没有持续管店”和“管店方式是否随着证据变得更好”。

3. 核心贡献

3.1 一个订单级、全年持续的商家环境

基准不是把每一天做成独立题目,而是维护一个连续状态:现金、保证金、在售商品、供应商状态、活动订单、待发生事件和店铺评分都会跨时间保留。控制期结束后,新需求和智能体动作停止,但已有订单仍继续结算,直到得到真正的期末净资产。

3.2 用真实需求轨迹建立非平稳机会集合

商品目录来自 1688 的真实业务数据,覆盖 2025-06-01 至 2026-05-31。数据保留“618”、双十一和春节等时间结构,并配有每天的市场报告。智能体不能只找到一批高销量商品后永久维持,而要发现当季机会、处理衰退商品并重新分配 50 个上架名额。

3.3 把供应端快反馈与订单端慢反馈接到同一条因果链

供应商的价格变化、下架和发货延迟较快可见;客户侧的取消、退款、退货和差评则沿订单生命周期延迟出现。智能体必须把后来发生的异常归因到早先选择的商品,再决定下架、替换、调价或继续观察。

3.4 同时比较模型能力与智能体脚手架

ReAct 只提供最小控制器和 26 项环境工具;Hermes 还带代码执行、规划、记忆和技能管理。相同模型在两个框架中的差异,能显示长期表现并非只由基础模型决定,历史压缩、显式记忆和程序化分析同样是系统能力的一部分。

3.5 从结果曲线与行为轨迹诊断失败,而非只报终局分数

论文除了期末净资产,还分析持续窗口率、月度工具调用、货架规模、选品与当月需求的对齐程度、单位订单利润、异常处理轨迹和记忆内容。这样可以区分“赚得少是因为停止运营”“选品与季节错配”“订单很多但单位经济性差”等不同原因。

4. MerchantBench 如何工作

4.1 任务形式:只有终局奖励的部分可观测决策过程

作者把环境写成有限时域 POMDP:

M=S,A,P,O,Z,R,μ0,Hc,Hc=8,760.\mathcal{M}=\langle\mathcal{S},\mathcal{A},P,\mathcal{O},Z,R,\mu_0,H_c\rangle, \qquad H_c=8{,}760.

环境每小时推进一步,智能体每 12 小时获得一次决策窗口,因此一年理论上有 730 个窗口。完整状态包括真实需求、风险概率和预采样的未来结果,但智能体只能看到商家在当时应能观察到的信息。中间奖励为零,最终目标是:

R(sT)=BT+DT+IT+QT,R(s_T)=B_T+D_T+I_T+Q_T,

其中 BTB_T 是现金余额,DTD_T 是保证金,ITI_T 是在途资金,QTQ_T 是应收账款。这样的设计避免用密集奖励替智能体规定策略,但也让信用分配非常困难:一次选品究竟好不好,可能要等多轮订单结果与季节变化后才能判断。

4.2 初始资源与经营约束

每个店铺初始拥有:

资源初始值
可用现金2,000 元
保证金1,000 元
最大在售商品50 个
决策频率每 12 小时一次
控制周期365 天

现金用于每笔订单的即时采购和已实现损失;未支付罚款会从保证金扣除,保证金耗尽则经营终止。这个约束创造了真实的时间错配:订单到来是好消息,却会在结算前先吞掉流动性。

4.3 商品数据与需求生成

经过过滤的目录含 10 个一级类目、98,843 个商品与 36,576 家供应商。每个商品有 365 天历史需求、价格和公开供应商属性。对于商品 ii、商家 mm、小时 tt,订单强度为:

λm,i,t=Di,d(t)wc(i),h(t)rm,tm,i,t(pm,i,t/piref)ϵi.\lambda_{m,i,t}=D_{i,d(t)}w_{c(i),h(t)}r_{m,t}\ell_{m,i,t} \left(p_{m,i,t}/p_i^{\mathrm{ref}}\right)^{-\epsilon_i}.

可将它理解为五项相乘:真实日需求、类目小时分布、店铺评分影响、上架曝光周期,以及相对价格的弹性影响。环境再从 Poisson 分布采样订单数。这里的关键不是公式复杂,而是智能体的调价、商品年龄和店铺声誉都会改变未来流量。

上架曝光先经历 14 天冷启动爬坡,之后指数衰减到最低水平。于是,即使某件商品没有显式故障,永久不换货架也会逐渐损失曝光;选品成为持续的组合管理问题。

4.4 上游供应事件

供应池会按商品级概率触发三类事件:

  • 采购价格变化:基础价格乘以 0.9–1.5 的随机因子;
  • 商品下架:暂时无法采购;
  • 发货延迟:额外增加 12–96 小时。

供应商异常会在 168–672 小时后恢复。智能体能查询当前价格、库存、可用状态和发货时间,却看不到异常标记、触发概率与恢复日程。库存不足也可能由真实订单消耗自然产生,而不是一个显式异常事件。

4.5 下游订单生命周期

MerchantBench 采用单件代发模型。每一笔订单沿以下链路推进:

Order Placed -> Procured -> Shipped -> Delivered -> Settled

下单后立即按当前供应价采购并扣现金;送达后销售收入先进入应收,正常订单再于最长 168 小时内结算回现金。订单创建时会预先获得一个隐藏客户结果,直到生命周期推进到相应节点才显现。

除了正常履约,环境包含六类异常:

异常直接影响是否影响店铺评分
Cancellation返还采购成本不计入评分
Stockout无法完成采购,并处罚
Late Shipment逾期但继续履约,并处罚
Returnless Refund撤回应收,不退采购成本
Return and Refund撤回应收、返还采购成本,并处罚
Bad Review保留销售收入,但处罚

已实现结果按不同经验分和证据权重进入带时间衰减的店铺评分。评分再映射为需求乘数,最低区间只有 0.10,最高区间为 1.20。因此,一个商品的风险可以经由店铺评分传导到整个商品组合,这正是论文所说的订单级风险传播。

4.6 四类控制任务与 26 项工具

工具接口围绕四个相互依赖的决策模块组织:

  1. Product Sourcing:读取每日市场报告、搜索目录、查看商品与供应商;
  2. Listing and Pricing Control:上架、下架、调价、查看商品表现;
  3. Cash-Flow Management:查看现金、保证金、在途款、应收、罚款与关店风险;
  4. Mixed-Latency Feedback Adaptation:追踪供应变化和订单结果,并回到前三类决策修正策略。

每日市场报告明确只包含截至前一天的证据,未来需求、真实风险率与尚未揭示的订单结果始终隐藏。这个边界能防止智能体直接读取仿真内部变量“作弊”。

4.7 ReAct 与 Hermes 的关键差别

ReAct 的动作空间就是 26 项商家工具,适合观察基础模型本身的推理与调用能力。Hermes 在相同商家工具外加入:

  • 代码执行与终端;
  • 显式规划和持久记忆;
  • 技能创建、调用与修订;
  • 框架自己的长期历史管理。

两者都会压缩上下文。ReAct 在历史达到 160,000 tokens 时提醒模型写入持久记忆,然后截断到最近 30,000 tokens;Hermes 使用默认摘要程序。两种情况下都由被评测模型自己充当摘要模型。这一点很重要:基准测到的并非孤立模型,而是“模型 × 记忆压缩 × 工具框架”的系统表现。

5. 实验设计

5.1 模型、框架与基线

论文评估 GPT-5.6 Sol、Claude Opus 4.8、Qwen3.7-Max、Qwen3.7-Plus、GLM-5.2、DeepSeek-V4-Pro、DeepSeek-V4-Flash 与 Kimi K2.6。每个模型分别接入 ReAct 和 Hermes,每种配置运行 3 次。

另外设置两类基线:

  • Rule-based:每天检查异常,下架连续 7 天无销量或受到供应事件影响的商品,并根据市场报告补满货架;
  • Human:3 名没有电商经营经验的参与者,各自在 5 个现实日内完成一次 365 天仿真。

5.2 指标为什么分成三组

维度指标想回答的问题
商业表现期末净资产、GMV、净利率、订单量最终是否创造经营价值
店铺可靠性总罚款、平均评分、订单异常率是否以可持续质量经营
长期活跃平均在售数、SWR、工具调用数是否持续维持控制回路

其中 SWR(Sustained Window Rate) 是所有滚动 30 天区间中,“至少调用过一次环境工具的计划窗口比例”的最小值。使用最差窗口而不是全年平均,能捕捉智能体在某一阶段突然停摆的现象。

6. 主要实验结果

6.1 终局表现:最强智能体仍远低于人类

下表保留最能解释论文结论的指标;净资产与 GMV 单位为千元,结果均为 3 次运行的均值。

配置净资产GMV净利率订单平均评分SWR工具调用
ReAct + GPT-5.6 Sol40.8974.1951.3%9964.0499.4%7,257
ReAct + Qwen3.7-Max20.6639.7344.5%9253.9011.1%815
ReAct + Kimi K2.624.9963.6932.9%2,2303.8910.6%1,228
Hermes + GPT-5.6 Sol52.93133.0740.2%3,2514.0966.1%4,831
Hermes + Qwen3.7-Max59.46116.7646.9%1,9293.9022.2%1,366
Hermes + GLM-5.242.32103.0636.9%2,7314.0562.8%1,792
Human217.61608.0635.3%9,4423.98100.0%8,311
Rule-based24.4853.3740.3%1,6053.76100.0%3,236

最佳 LLM 配置的净资产为 59.46 千元,人类均值为 217.61 千元,比例是 27.3%。有意思的是,人类净利率 35.3% 并不最高,却用更大的订单规模与持续运营取得更高总资产。这提醒我们:长期经营目标不能简化为每单利润最大化,规模、周转、风险和组合宽度必须共同优化。

规则系统也揭示另一个基线价值:它的净资产只有 24.48 千元,但 SWR 为 100%。机械地坚持行动能防止停摆,却不能保证选品与经营质量;反过来,高利润率也不能弥补货架萎缩和机会遗漏。

6.2 框架效应很大,但不是普遍增益

对 8 个模型取平均,Hermes 相比 ReAct:

  • 期末净资产高 53.3%;
  • GMV 高 71.5%;
  • 订单量高 71.2%。

7 个模型在 Hermes 下净资产更高,增幅从 Claude Opus 4.8 的 11.5% 到 Qwen3.7-Max 的 187.8%。唯一例外是 Kimi K2.6,净资产下降 4.1%。因此,记忆、代码与技能机制是重要杠杆,却不是可无条件套用的增强层;不同模型能否正确使用这些能力,决定了增益是否兑现。

附录进一步显示,GPT-5.6 Sol 会用代码批量计算定价、检查商品数与最低毛利;Claude Opus 4.8 更依赖 261 次记忆调用;部分模型从不使用代码工具。Hermes 的额外能力不会自动转化为等量收益,它更像放大器:偏好量化记录的模型得到更多帮助,纯语言式运营者可能几乎不变。

6.3 平均值掩盖了高方差

ReAct 中 GPT-5.6 Sol 的净资产变异系数最低,为 3.3%;Hermes 中 Claude Opus 4.8 最低,为 10.0%。最高均值配置 Hermes + Qwen3.7-Max 的变异系数却达到 55.1%

这对智能体部署尤其关键。如果一次优秀轨迹与一次失败轨迹之间差异巨大,只报告平均值会高估可用性。真实业务更关心尾部风险、最差运行和可重复性,而 MerchantBench 每个配置只有 3 次重复,现有估计仍然很粗。

6.4 持续调用工具与探索更多商品通常有益,但远远不够

48 次 LLM 运行中,更广的商品探索、更高的工具调用量与期末资产呈正相关。但散点分布很宽,说明活动量只是必要信号之一。Kimi K2.6 某次 ReAct 运行完成 3,004 笔订单,每单净利润只有 11.1 元;规模没有自动带来最高收益。

论文进一步定义 Monthly Demand Alignment Percentile:按上架小时加权,衡量当月在售商品相对全目录需求的百分位。人类从 6 月的 56.1 上升到 12 月和 1 月的 80 以上;规则系统长期停留在目录中位附近。更高的季节性组合调整收益与期末资产正相关,但作者明确指出,最终结果还受定价、现金流与订单管理影响,不能把相关关系解释为唯一因果机制。

7. 长期一致性失败是如何发生的

7.1 操作一致性:控制回路逐渐消失

人类参与者 SWR 为 100%;LLM 在 ReAct 下分布于 10.6%–99.4%,Hermes 下分布于 17.8%–66.1%。Qwen3.7-Max 的季度有效窗口率在 Hermes 下从 62% 降到 37%,在 ReAct 下从 68% 降到 23%。这不是某一步调用错误,而是数月尺度的活动衰减。

论文观察到两种模式:

  • Control-Loop Narrowing:智能体从主动选品、调价、替换和诊断,退化为只处理供应异常;
  • Premature Abandonment:智能体在仍有可行动作时错误判断商店无法恢复,然后等待时间流逝。

一个 Hermes + Kimi K2.6 轨迹在第 104 天得出“无法恢复”的结论,此后剩余 523 个窗口中有 355 个没有任何环境动作。这说明 autonomy 不能只定义为“没人指导时能执行工具”,还应包括长期保持主动目标追求。

7.2 策略一致性:行动没有被证据正确更新

作者把策略一致性继续分为:

  • Goal Consistency:跨时间的决策是否仍服务期末净资产;
  • Evidence-Calibrated Adaptation:策略改变是否与现金、季节需求和历史结果的证据强度相匹配。

人类在早期现金紧张时选择低价商品,资金增加后扩大采购价格范围;高价值实验不佳时,又会回到低价高周转品。其平均在售采购价从前三个月的 43.4–53.1 元,升至最后三个月的 58.7–90.8 元。多个模型的价格轨迹却基本平坦,说明它们没有随资金条件扩展策略空间。

7.3 延迟风险要求“归因—处置—替代”完整链条

面对退款或差评,较好的轨迹会定位责任商品并替换。人类还会继续搜索相似关键词,既移除风险又尽量保留原需求机会。只检测异常并下架,仍会造成货架空缺;只等待更多证据,又可能让坏商品持续伤害店铺评分。

店铺级适应也需要间接干预。一个 GPT-5.6 Sol 轨迹在评分下降后,对已验证且无异常的商品降价,以增加正常结算并恢复评分;Qwen3.7-Max 在早期差评导致三星后一次调整 40 个商品。两者都理解了“商品异常 -> 店铺评分 -> 全店需求”的传播,但激进程度不同。

7.4 记忆既能保存经验,也能固化错误

论文给出的两个案例尤其有警示性:

  • Claude Opus 4.8 错误推断“删除弱商品会把流量集中到剩余商品”,货架从第 54 天的 47 个商品缩至第 322 天的 3 个;环境实际上为每件商品独立提供需求机会。
  • Qwen3.7-Max 在第 282 天把第 285 天误记为经营终点,于是停止补充空位,而真实终点还剩 83 天;直到模拟日期越过其错误终点后才纠正。

长期记忆不是天然的解决方案。未经来源、置信度和失效条件管理的记忆,会把一次局部误判升级成数月策略。未来系统需要的不只是“记住”,而是可审计的假设、反证检查和定期重验证。

8. 如何理解这篇论文的真正价值

8.1 它评测的是闭环治理,不只是工具熟练度

MerchantBench 的难点来自四条反馈环同时存在:

反馈环时间尺度所需能力
订单—现金即时采购、延迟结算流动性预测与规模控制
供应—履约小时至数周异常监测、替换与恢复判断
质量—评分—需求多订单累积风险归因与组合级修复
季节—选品—利润月度至全年趋势识别与资产配置

只优化任何一条都可能伤害整体目标。例如提高订单量会压现金,扩大高价商品会增加单位风险,频繁下架会丢失曝光,追逐当季需求却缩小货架也未必增加利润。

8.2 “模型排行榜”不是最稳健的读法

每个配置只重复 3 次,而最好配置恰好方差很高;框架还改变了工具、记忆、代码与技能条件。因此,表 1 更适合说明能力结构和系统差距,不宜把很小的均值差解释成稳定排名。

最可靠的结论是方向性的:

  1. 当前被测智能体整体远低于人类基线;
  2. 框架设计显著影响长期结果;
  3. 持续活动、季节性选品和证据校准都与更好结果相关;
  4. 长期记忆与运行时长本身不能保证长期一致性。

8.3 27.3% 不是“模型只有人类 27.3% 能力”

这个数字只表示:在该仿真、该初始资源、该指标和三次重复下,最佳 LLM 配置的平均期末净资产是三名人类均值的 27.3%。它不能直接外推为通用智能、真实电商能力或所有长期任务的相对水平。人类和智能体的时间预算、交互界面、先验、计算成本也没有被统一成同一种资源。

9. 局限与需要补充的证据

9.1 统计样本不足以支撑精细排名

每个模型—框架组合只有 3 次运行,人类也只有 3 人各 1 次。论文没有在主表提供置信区间或显著性检验。55.1% 的高变异系数已经表明随机轨迹影响很大;若要可靠比较相近配置,需要更多随机种子、bootstrap 区间和尾部失败率。

9.2 人类基线代表性有限

三名参与者都没有电商运营经验,并在 5 个现实日内完成一年仿真。这个设计避免“专家碾压”,却不能代表专业商家上限;同时,论文没有详细报告参与者的操作时长、学习曲线和界面负担。人类均值应理解为一个小样本参考点,不是稳定的人类能力标尺。

9.3 真实数据支撑环境,但不随公开代码发布

官方仓库明确说明:真实业务数据不包含在开源制品中;默认场景使用确定性的合成目录,只有 1,000 个商品和 200 家供应商。外部研究者可以检查模拟器、SDK、基线和测试,却无法直接复现论文中 98,843 商品环境的完整结果。这限制了结果复核、分布审计与跨团队比较。

9.4 仿真有效性仍需现实校准

需求函数、价格弹性、曝光曲线、评分到需求的映射、异常恢复时长与罚款规则共同决定最优策略。论文给出了详细参数,这是优点;但这些机制仍是对现实的抽象。真实电商还包含广告竞价、竞争对手、批量库存、平台流量分配、客服、营销活动、法规和供应谈判。仿真中的高分策略未必能迁移到真实店铺。

9.5 框架对比包含多个同时变化的因素

Hermes 相比 ReAct 同时增加代码、规划、记忆、技能和不同的上下文压缩策略。53.3% 的净资产增益无法归因于某个单独组件。需要逐项消融:只加结构化记忆、只加代码、固定同一摘要器、禁用技能自更新,才能知道增益从哪里来。

9.6 自摘要会把模型能力与记忆质量绑定

每个模型都用自己做历史摘要。能力较弱的模型可能不仅当下决策较差,还会把错误信息压入记忆,产生复合劣势。若要区分“推理能力”和“历史维护能力”,应增加统一高质量摘要器、原始事件数据库和可检索结构化账本等对照。

9.7 评测成本和资源效率没有进入主结论

论文报告环境工具调用,却没有系统给出模型 token 消耗、API 成本、推理延迟、代码执行成本和每单位净资产的计算开销。GPT-5.6 Sol 的 ReAct 轨迹平均调用 7,257 次环境工具,人类为 8,311 次;调用多不等同于经济划算。生产部署需要把收益、可靠性与计算成本放进同一评价函数。

9.8 终局资产目标仍可能诱导不现实策略

环境中间奖励为零,有利于减少人工塑形;但单一期末净资产也未显式包含客户公平、供应商关系、平台合规、风险暴露和运营劳动。平均评分与异常率只是观测指标,不一定能约束所有不良经营行为。长期智能体基准最终需要多目标约束与安全审计。

10. 应用与影响

10.1 对智能体工程的直接启示

MerchantBench 指向的工程重点不是继续堆叠自然语言记忆,而是建立可验证的运营状态:

  • 用结构化账本记录商品、订单、现金和假设,不让摘要成为唯一事实源;
  • 给每条策略记忆附带证据、时间戳、置信度与失效条件;
  • 定期检查货架宽度、未跟进事件、异常商品和长期无动作窗口;
  • 将“发现风险—移除风险—寻找替代—验证恢复”固化为完整流程;
  • 对季节性策略做反事实比较,避免把市场自然变化误认为自身策略有效;
  • 设置独立监督器检查目标漂移、提前放弃和日期记忆错误。

10.2 对其他长期领域的可迁移价值

同样的评测结构可迁移到:

  • 云资源运营:扩容立即花钱,可靠性和成本后续显现;
  • 客户成功:今天的沟通影响数周后的续约与流失;
  • 供应链管理:采购、运输、库存和缺货具有不同延迟;
  • 软件维护:修复、回归、用户反馈和技术债跨版本累积;
  • 研究智能体:检索、假设、实验失败和证据更新跨长周期发生。

共同点都是部分可观测、反馈异步、资源受限且目标持续。MerchantBench 的最大影响可能不是电商本身,而是提供了一种把长期智能体从“长上下文问答”转向“持续控制系统”的设计范式。

10.3 潜在风险

如果把基准误当作自动经营授权,可能带来错误定价、现金耗尽、供应商误判和消费者权益问题。真实业务数据也涉及商业敏感性与隐私。合理路径应是先在沙箱中做压力测试,再以严格额度、审批阈值、异常熔断与人类复核进入低风险流程;高影响定价、下架、退款和合规动作不应仅凭单个智能体自主执行。

11. 与相关工作的关系

11.1 电商智能体基准

WebShop、ShoppingBench 等工作更关注买家侧购物、网页交互或一次性交易;EComStage、BargainBench、Market-Bench 与 Magentic Marketplace 覆盖商家流程、谈判或经济主体竞争,但评测单位通常仍是任务、对话、交易或有限竞争回合。MerchantBench 的区别在于持续经营同一家店,并让订单后果反过来改变未来需求和资金。

11.2 长时经营与零售环境

Vending-Bench 系列已经把智能体置于长期商业运营中;RetailBench 使用 96 个固定杂货商品评测证据获取、行动转化与后续跟进。MerchantBench 在此基础上加入近十万商品的动态机会集合、真实全年需求曲线和订单级延迟售后结果,使选品与风险适应更复杂。

11.3 通用长程智能体评测

UltraHorizon、OdysseyBench、OSWorld 等从办公、探索、虚拟世界、网页和计算机操作评测长程能力。MerchantBench 的互补点是引入可累积的经济结果:错误不是只造成一步失败,而会通过现金、罚款、评分、曝光与机会成本逐步传播。

12. 综合评价

维度评价理由
问题重要性长期一致性是从演示型智能体走向持续部署的核心缺口
环境设计POMDP、订单生命周期、延迟反馈与非平稳需求形成真正闭环
数据现实性中高以真实 1688 轨迹校准,但关键业务数据不公开
实验覆盖中高8 模型、2 框架、48 次全年运行,行为分析丰富
统计可靠性中低每配置 3 次、人类仅 3 人,高方差下不足以精细排名
可复现性代码与合成数据开放,论文主实验真实数据无法直接复现
现实外推性中低仿真省略大量真实竞争、营销、合规与组织因素
诊断价值明确区分操作衰减、目标漂移、证据失配和记忆固化

这篇论文最有价值的结论可以浓缩成三点:

  1. 长期能力不是上下文长度,也不是让循环运行更多天,而是持续目标追求与证据校准。
  2. 智能体框架能显著改变结果,但记忆、代码和技能只有被正确使用时才产生收益。
  3. 持久记忆必须可验证;否则它会把局部错误变成长期政策。

MerchantBench 还没有证明任何模型可以自主经营真实店铺,却准确暴露了当前系统为什么不能:它们会逐渐不再行动,会把局部反馈误读为全局规律,会忘记真实终点,也会在记忆中重复强化未经验证的假设。相比再增加一个短任务成功率,这种失败剖面更接近长期智能体研究真正需要解决的问题。

参考资料

  1. Hugging Face Papers:https://huggingface.co/papers/2607.28956
  2. Qiming Shi et al., MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations, arXiv:2607.28956v2:https://arxiv.org/abs/2607.28956
  3. arXiv HTML 完整正文与附录:https://arxiv.org/html/2607.28956
  4. MerchantBench 官方项目页:https://air.1688.com/kapp/next1688/merchantbench/
  5. MerchantBench 官方代码仓库与数据开放说明:https://github.com/KhanCold/merchantbench
  6. Vending-Bench:https://arxiv.org/abs/2502.15840
  7. RetailBench:https://arxiv.org/abs/2603.16453
  8. ReAct:https://arxiv.org/abs/2210.03629

本文基于公开论文、完整附录与官方代码仓库撰写。论文实验使用的真实业务数据未随代码公开,结果尚需更多独立重复与现实环境验证。