Logo
热心市民王先生

[硅基写手] Hugging Face Papers 每日论文解读:RNG-Bench

论文解读 Multimodal LLM Benchmark Memory Hugging Face arXiv

基于 2026-06-19 早间 Hugging Face Papers 顶部论文 RNG-Bench,解读非马尔可夫交互、多模态模型隐藏状态重建、Memory Gap 指标和可控游戏评测。

自动研究时间:2026-06-19 09:00(Asia/Shanghai)
抓取路径:Hugging Face Papers 最新列表 -> 顶部论文详情页 -> arXiv Page -> arXiv HTML / PDF -> 项目页与 GitHub 仓库交叉核对
抓取状态:Hugging Face /papers 在本次抓取时显示 Jun 18 Daily Papers,顶部论文为 #1 Paper of the day

执行摘要

本次自动调研从 Hugging Face Papers 顶部获取到的论文是 Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games。截至 2026-06-19 09:00(Asia/Shanghai)抓取,Hugging Face 详情页为 https://huggingface.co/papers/2606.19338,对应 arXiv 页面为 https://arxiv.org/abs/2606.19338,arXiv HTML 为 https://arxiv.org/html/2606.19338v1

一句话概括:RNG-Bench 不是再做一个普通游戏 benchmark,而是专门测试多模态大模型能否在 closed-loop interaction 中记住已经消失的观察、重建隐藏状态,并把这份记忆用于下一步行动。

论文最有价值的地方是把“长上下文里有没有看过信息”和“交互中能不能用过去信息行动”区分开来。很多长上下文评测是 remember-to-answer:模型读完轨迹后回答一个问题;RNG-Bench 测的是 remember-to-act:模型每一步都要根据已经不可见的历史观察行动,一次记忆错误会改变后续观测,错误会沿 episode 传播。作者用两个可控非马尔可夫游戏 Matching Pairs 和 3D Maze,把隐藏状态重建、视觉绑定、空间地图维护、动作选择分开诊断,并提出 Memory Gap 指标来区分“忘了”与“会想但选错动作”。

1. 论文基本信息

项目内容
Hugging Face 详情页https://huggingface.co/papers/2606.19338
arXiv 页面https://arxiv.org/abs/2606.19338
arXiv HTMLhttps://arxiv.org/html/2606.19338v1
arXiv PDFhttps://arxiv.org/pdf/2606.19338
项目页https://internlm.github.io/RNGBench/
GitHub 仓库https://github.com/InternLM/RNGBench
论文标题Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games
作者Shengyuan Ding, Xilin Wei, Xinyu Fang, Haodong Duan, Dahua Lin, Jiaqi Wang, Yuhang Zang
机构Fudan University; Shanghai Innovation Institute; Shanghai Artificial Intelligence Laboratory; Zhejiang University; The Chinese University of Hong Kong
arXiv 编号2606.19338
arXiv 版本v1, 2026-06-17
Hugging Face 榜单状态2026-06-18 Daily Papers 顶部论文,#1 Paper of the day
关键词Multimodal LLM, Non-Markov Games, Closed-loop Evaluation, Memory, POMDP, Benchmark

2. 研究背景和动机

2.1 为什么多模态模型需要“当前观察之外”的能力

多模态模型正在被部署到更接近 agent 的 closed-loop 场景中:机器人看一眼房间后移动,浏览器 agent 记住之前点击过什么,游戏或工具使用模型根据几步前的线索决定下一步动作。在这些场景里,当前屏幕、当前图像或当前 observation 往往不是完整状态。

传统视觉问答或静态图像理解主要考察当前输入;普通长上下文评测考察模型能否从长文本里找回证据;许多游戏评测又把记忆、规划、规则理解、动作格式、探索能力混在一起。论文认为这些都无法精确回答一个问题:当关键信息曾经出现过、现在已经不可见时,模型是否能在交互中维护一个内部 belief state,并用它行动?

这就是非马尔可夫问题。对于围棋、象棋等完全可见游戏,当前棋盘基本决定合法行动和策略空间;但在 Matching Pairs 中,两张看起来完全一样的背面牌可能因为历史翻牌不同而要求完全不同的行动。模型必须记住“哪个图案曾经出现在 A1、B3”,而不是只看当前画面。

2.2 现有 benchmark 的缺口

论文把已有评测分成三类:

类型典型问题对 RNG-Bench 的启发
完全可见游戏当前状态已经包含决策所需信息不能隔离历史记忆
Agent / 多环境套件隐藏信息和探索、规则、动作格式混在一起需要更可控的闭环环境
长上下文与记忆问答通常是读完后回答,不影响下一步观察需要 remember-to-act,而不是 remember-to-answer

RNG-Bench 的设计目标是:规则简单、环境合成可控、难度可扩展、输出格式严格解析,并且每一步行动都会反馈到环境,让记忆错误真正改变后续轨迹。

3. 核心贡献和创新点

3.1 RNG-Bench:两个互补的非马尔可夫游戏

论文提出 RNG-Bench(Reconstructive Non-Markov Games),包含两个环境:

  • Matching Pairs:静态、离散、类别型隐藏状态。牌的位置和身份固定,但身份只在翻开时短暂可见,之后又盖回去。模型要维护 identity-location binding。
  • 3D Maze:动态、空间、结构型隐藏状态。模型只看到第一人称局部视野,需要从局部观察中逐步重建地图、位置、朝向和已访问区域。

两者都把规则理解做得很简单,把困难集中到“过去观察如何变成可用 belief state”上。Matching Pairs 更像记忆绑定问题,3D Maze 更像空间地图构建问题。

3.2 三个可控难度轴和统一 harness

RNG-Bench 沿三个主轴调节难度:

Matching Pairs3D Maze诊断意义
Scale4x4 到 12x14 棋盘5x5 到 15x15 迷宫增加隐藏状态容量和 episode 长度
Modalitytext, ASCII image, pattern imagetext-symbolic, 2D patch, 3D scene分离文本记忆和视觉绑定
Patternpoker, noise, textures, perlin 等wall-style variants测试视觉身份是否稳定
External memoryoracle re-show prior snapshotsminimap on / off观察外部状态能否缩小 Memory Gap

作者强调,两个环境共享统一 harness 和严格 parser。这样,当模型成绩下降时,更可能归因于隐藏状态追踪,而不是动作格式错误或规则没有读懂。

3.3 Memory Gap:把遗忘和决策错误拆开

论文提出 Memory Gap 指标。核心思路是对同一个模型、同一个实例运行两种条件:

  • Normal:模型只看到当前 observation 和上下文历史。
  • Oracle:每一步都把真实隐藏状态注入 prompt,相当于给模型外部记忆。

指标定义为:

MemoryGap(m)=(1S(m)S(m))×100%\mathrm{MemoryGap}(m)=\left(1-\frac{S(m)}{S^*(m)}\right)\times 100\%

其中 (S(m)) 是 normal 条件得分,(S^*(m)) 是 oracle 条件得分。Gap 大,说明瓶颈更像是隐藏状态重建;Gap 小,则可能是感知、规则理解或决策选择本身的问题。

3.4 Duel protocol:消除实例随机性的双模型对战

Matching Pairs 还引入 head-to-head duel:两个模型在同一块牌面上轮流行动,双方都能看到自己和对手翻出的牌,但看不到对手推理。每个 matchup 会交换先后手,减少 first-mover bias。

这个设计比单模型跑不同随机种子更严格,因为它让两个模型面对完全相同的隐藏状态结构,并测试模型是否能利用“对手翻开的牌”作为自己的记忆输入。

4. 技术方法论详解

4.1 POMDP 表述

论文把每个实例建模为 Partially Observable Markov Decision Process:

(S,O,A,T,Z,R)(\mathcal{S}, \mathcal{O}, \mathcal{A}, T, Z, R)

其中 (\mathcal{S}) 是真实状态空间,(\mathcal{O}) 是观测空间,(\mathcal{A}) 是动作空间,(T) 是状态转移,(Z) 是观测函数,(R) 是奖励。模型在第 (t) 步看到当前 observation (o_t) 和 episode history:

ht=(o1,a1,,ot1,at1,ot)h_t=(o_1,a_1,\ldots,o_{t-1},a_{t-1},o_t)

然后作为 history-based policy 输出动作:

π(atht)\pi(a_t \mid h_t)

如果当前 observation 已足够决策,则有:

π(atot)=π(atht)\pi^*(a_t \mid o_t)=\pi^*(a_t \mid h_t)

非马尔可夫场景则相反:两个不同历史可能导致相同当前 observation,但最优动作集合不同。RNG-Bench 要测的正是模型能否从 (h_t) 中维护有效 belief state。

4.2 Matching Pairs 流程

flowchart TD
    A[生成成对卡牌并盖住] --> B[模型选择两个坐标]
    B --> C[环境短暂揭示卡牌身份]
    C --> D{是否匹配}
    D -->|是| E[移除该对子并保留得分]
    D -->|否| F[重新盖住卡牌]
    E --> G[更新历史上下文]
    F --> G
    G --> H{达到完成或预算上限}
    H -->|否| B
    H -->|是| I[统计 Score 和 Resp per Score]

这个环境的关键隐藏状态是“已经看过但当前不可见的身份-位置绑定”。如果模型忘记某张牌在哪里,就会重复翻旧牌、错过已知对子,或在后期无法把零散线索合并成稳定策略。

4.3 3D Maze 流程

3D Maze 从左上角起点走到右下角目标点,默认没有 top-down map,模型只收到第一人称视角和对话历史。动作空间包括 move_forwardturn_leftturn_right。隐藏状态包括:

  • 迷宫拓扑:哪些格子连通,哪里是墙;
  • 当前位置和朝向;
  • 已访问区域;
  • 从局部视野推断出的全局空间结构。

论文设置 loop rate 让迷宫存在额外通路,避免简单 wall-following 策略解决任务。它还评估 minimap、ask-output map、历史窗口长度等干预,以观察模型到底是缺信息、不会建图,还是会建图但不会规划。

4.4 评估指标

环境指标含义
Matching PairsScore%成功匹配的对子比例,越高越好
Matching PairsResp./Score每成功匹配一对需要多少次响应,越低越好
Matching PairsPF / IAparse failure / invalid action
3D MazeSR%在预算内到达终点的比例
3D MazeEfficiency最短路径长度 / 实际路径长度,只在成功 episode 上计算
3D MazeExplore%探索覆盖比例
3D MazeWalls撞墙次数
3D MazeGS%综合 success rate、efficiency、exploration 的 Game Score

5. 实验设计和主要结果

5.1 评估规模

论文和项目页给出的 stress setting 很重:最难配置大约达到 128K tokens350 张图像输入 / episode。这不是单张图问答,而是长交互轨迹、图像序列和动作历史共同组成的多模态长上下文压力测试。

评估模型包括 GPT-5.4、Gemini-3.1-Pro、Kimi-K2.5、Qwen3.5-397B、Seed-2.0-Lite 等 frontier MLLMs。论文还用 Qwen3.5-9B 做了非马尔可夫轨迹监督微调实验。

5.2 单模型主结果

在项目页展示的主设置中,Matching Pairs 使用 10x10 image noise theme,3D Maze 使用 13x13 no-minimap maze,平均最优路径 60 步。

模型Matching Pairs Score%Resp./Score3D Maze SR%3D Maze GS%
GPT-5.462.38.0120.030.5
Gemini-3.1-Pro50.010.0050.049.7
Seed-2.0-Lite43.211.5720.021.7
Kimi-K2.538.013.1610.016.1
Qwen3.5-397B25.319.740.010.5

几个关键读数:

  • GPT-5.4 在 10x10 图像 Matching Pairs 上最好,但只匹配 62.3% 的对子,远未饱和。
  • Gemini-3.1-Pro 在 3D Maze 上最好,13x13 迷宫 SR 为 50.0%,GS 为 49.7%。
  • Qwen3.5-397B 在 Matching Pairs 小规模文本下可以很强,但在 10x10 图像 noise 和 13x13 迷宫上明显退化。
  • Matching Pairs 和 3D Maze 排名不一致,说明“身份-位置记忆”和“空间地图重建”不是同一种能力。

5.3 Duel 结果:排名会翻转

在 Matching Pairs image poker duel 中,每个模型对其他四个模型进行 16 局,覆盖先后手和不同 seed。

模型Win%WTLScore%Elo
Gemini-3.1-Pro100.0160036.51803
GPT-5.450.072725.31492
Qwen3.5-397B46.771818.01476
Kimi-K2.537.552918.01423
Seed-2.0-Lite15.6211312.31306

这很有意思:单模型 Matching Pairs 排名中 GPT-5.4 领先,但 duel 中 Gemini-3.1-Pro 赢下所有 matchup。原因是 duel 会奖励模型利用对手翻开的牌。也就是说,模型不只是记自己的 action-observation 历史,还要把对手揭示的信息纳入 belief state。

5.4 Scale、视觉和 action trace 的诊断

论文和项目页给出几个强诊断结果:

  • 规模一增大,性能迅速下降:Qwen3.5-397B 在 Matching Pairs 从 4x4 的 90.6% 掉到 12x12 的 0.7%;3D Maze GS 在 7x7 达到 66.7,15x15 降到 19.7。
  • 视觉身份绑定是瓶颈之一:Qwen3.5-397B 和 Kimi-K2.5 在文本 Matching Pairs 中可以接近完美,但在 noise-pattern image 下分别降到 38.3% 和 43.3%。
  • action trace 不是冗余信息:移除模型自己的 action history 后,GPT-5.4 在 10x10 Matching Pairs 上从 62.3% 掉到 15.3%,即使每次翻牌当前都可见。
  • 最优策略仍远强于当前模型:最强模型每匹配一对需要 8.01 次响应,而最优策略约 3.24 次,动作效率仍有约 60% 差距。

5.5 Memory Gap 说明主要错误来自遗忘

项目页总结,注入外部记忆后能恢复很大一部分 Memory Gap:Matching Pairs 约 46-51 points,3D Maze 约 31-41 points。这说明大量残差错误不是纯粹动作选择差,而是模型没有稳定维护过去观察形成的 hidden state。

但这不是说所有问题都是记忆。3D Maze 的 minimap 和 ask-output 实验显示,有的模型即使能描述地图,也不一定能把地图转化为有效路线规划;也有模型撞墙很少但反复绕圈,说明局部感知安全和全局完成任务是不同能力。

5.6 SFT:用模拟器轨迹训练可迁移

作者用 Qwen3.5-9B 做 supervised fine-tuning,训练数据来自两类:

  • opt32k:32K 条 optimal-policy 轨迹,由手写 oracle 生成;
  • rmix32k:26K optimal 轨迹 + 6K 由更大 MLLM 产生且通过 correctness filter 的成功轨迹,总量仍为 32K。

held-out scale 结果如下:

模型 / 数据Match Score%Match Resp./ScoreMaze SR%Maze GS%
Qwen3.5-9B base0.0-0.01.5
+ opt32k14.614.70.05.0
+ rmix32k29.56.810.016.3

结论是:oracle 轨迹能教会部分规则和策略,加入过滤后的模型成功轨迹后,模型获得更多“非完美策略会遇到的恢复状态”,因此匹配分数翻倍,响应成本约减半,并首次在 held-out maze 上出现非零成功率。外部 benchmark 上,记忆与空间推理组平均提升 3.4,一般多模态组平均变化约 +0.5,说明目标能力提升没有明显牺牲通用能力。

6. 关键图表和公式解读

6.1 Figure 1:Markov vs Non-Markov

Figure 1 的核心不是展示两个小游戏,而是展示评测对象的转变:在 Markov game 中,当前状态足以决定行动;在 RNG-Bench 中,当前画面只是局部投影。两个表面相同的状态,因为历史不同,最优动作可以不同。

这对多模态 agent 很关键。一个浏览器页面、机器人视角或工具状态往往只显示当前局部信息;如果模型不能把过去信息压缩成稳定 belief state,长上下文窗口再大也可能只是“保存了历史”,而不是“会使用历史”。

6.2 Table 1:为什么已有 benchmark 不够

Table 1 把 RNG-Bench 和 GameBench、AgentBench、BALROG、EMemBench 等放在一起比较。RNG-Bench 同时满足 multimodal、closed-loop、non-Markov focus、scalable difficulty,并且最大上下文约 128K、图像数约 350。它的定位不是覆盖最多任务,而是把一个能力维度挖深:交互式隐藏状态追踪。

6.3 Memory Gap 公式

MemoryGap(m)=(1S(m)S(m))×100%\mathrm{MemoryGap}(m)=\left(1-\frac{S(m)}{S^*(m)}\right)\times 100\%

如果 normal 得分是 40,oracle 得分是 80,那么 Memory Gap 是 50%。这意味着只要把隐藏状态外显给模型,得分能从 40 恢复到 80,模型原本丢掉的是大量历史状态信息。

这个指标的强点是直观、可干预;弱点是它依赖 oracle interface 的设计。论文也承认,它是 practical diagnostic,不是严格因果分解。因为 oracle prompt 自身可能改变模型行为,外部记忆也不等于模型内部真正拥有了同样的 belief state。

6.4 Training table:为什么模型 rollout 有价值

opt32k 是完美专家轨迹,rmix32k 加入 6K 个大模型成功轨迹。结果 rmix32k 明显优于 opt32k,说明训练 closed-loop policy 时,只有完美路径可能不够。实际模型会走到非最优状态,需要看到“出错后如何恢复”的分布。

这和机器人模仿学习、DAgger 一类思想很接近:只学专家最短路,部署时一旦偏离专家轨迹就不知道怎么回来;加入模型自己的成功 rollouts,可以提供更接近学生策略的数据分布。

7. 局限性和未来工作

7.1 环境覆盖有限

RNG-Bench 只包含 Matching Pairs 和 3D Maze。它们很适合诊断静态身份记忆和动态空间地图,但不能覆盖所有非马尔可夫任务。例如社交博弈、长周期网页操作、真实机器人操作、多工具软件工程任务里的隐藏状态都更复杂。

7.2 Memory Gap 不是严格因果证明

oracle 注入隐藏状态能缩小 gap,但这不等于所有差距都可严格归因于记忆。提示词变长、状态表达方式、模型对 oracle 信息的信任度都会影响结果。论文将其定位为 practical diagnostic,这个表述是谨慎的。

7.3 多模态感知和记忆仍耦合

Matching Pairs 的文本和图像差距说明,模型可能不是“忘了”,而是最初就没有稳定识别图案。尤其是 poker、noise、textures 等视觉模式中,身份绑定依赖视觉 encoder 的细粒度稳定性。因此 RNG-Bench 虽然试图隔离 memory,但在 image setting 中,memory 和 perception 不可能完全解耦。

7.4 SFT 只验证一个基座模型

训练实验集中在 Qwen3.5-9B。它证明了非马尔可夫轨迹监督有潜力,但还不能说明同样 recipe 对 Gemini、GPT、Kimi、Seed 或开源不同架构都有效。数据规模、轨迹过滤、oracle 策略和视觉分辨率也可能影响外推。

7.5 未来方向

后续可以沿几个方向推进:

  • 扩展到更多真实 agent 场景,如浏览器、GUI、机器人 manipulation、代码仓库导航;
  • 设计更细粒度的 belief-state probing,直接检查模型内部是否保留身份-位置绑定;
  • 结合外部 memory module,比较纯 in-context、显式 scratchpad、结构化 memory map 的差异;
  • 用 interactive data aggregation 训练模型,让模型学习从错误轨迹中恢复;
  • 研究视觉身份绑定和长程记忆的交互,避免把感知错误误判为记忆错误。

8. 实际应用场景和潜在影响

8.1 多模态 agent 评估

RNG-Bench 适合成为多模态 agent 的基础诊断项。浏览器 agent、手机 agent、桌面 agent 经常需要记住几步前页面上出现过的控件、文件名或状态。传统静态 VQA 很难发现这些问题,而 RNG-Bench 的 closed-loop 机制会让一次遗忘在后续轨迹中显性化。

8.2 机器人和具身智能

3D Maze 映射到机器人导航中的局部视野建图问题。机器人不会一直看到完整地图,必须把过去观察整合成空间 belief state。论文发现 minimap 不总能解决问题,提示真实系统中仅提供外部地图还不够,模型还要能把地图和自身位姿绑定起来。

8.3 长上下文模型的新评价维度

128K tokens 和 350 images per episode 的设置说明,长上下文能力不能只看“能塞多少 token”。更重要的是:模型能否在长交互历史中保留可行动的信息,能否避免注意力稀释和错误历史累积。

8.4 训练数据构造启发

rmix32k 优于 opt32k 的结果对 agent training 很有启发:只用最优专家轨迹可能不足以训练闭环策略,过滤后的模型成功轨迹提供了更接近实际策略分布的恢复样本。这对 GUI agent、tool-use agent、机器人 imitation learning 都有借鉴价值。

9. 相关工作和领域背景

RNG-Bench 位于四个方向的交叉点。

第一是 POMDP 和 belief-state tracking。经典强化学习里,部分可观察环境要求 agent 从历史中推断隐藏状态。RNG-Bench 把这个问题搬到多模态 LLM 的 in-context policy 中,不额外训练显式 belief module,而是直接测试模型用上下文维护状态的能力。

第二是 game-based agent evaluation。GameBench、BALROG、TextArena、MACHIAVELLI 等都使用游戏评估推理和行动,但很多任务要么完全可见,要么把隐藏信息、探索、规则和动作格式混合在一起。RNG-Bench 的差异是专门让 non-Markov recall 成为主变量。

第三是 long-context and memory benchmarks。LongBench、RULER、HELMET、EMemBench 等关注长上下文证据使用和记忆问答。RNG-Bench 则进一步要求记忆驱动行动,并让错误反馈到环境。

第四是 multimodal perception-memory coupling。论文的视觉 pattern ablation 显示,图像身份稳定性会显著影响记忆表现。这对多模态模型评测很重要,因为“看不清”“绑定错”“记不住”在最终分数上可能表现相似,需要用干预实验拆开。

10. 关键要点总结

  • Hugging Face Papers 在 2026-06-19 09:00 抓取时显示 Jun 18 Daily Papers,顶部论文为 RNG-Bench。
  • RNG-Bench 测的是 remember-to-act,而不是普通 remember-to-answer。
  • 两个核心环境分别覆盖静态身份-位置记忆(Matching Pairs)和动态空间地图重建(3D Maze)。
  • 最难配置约 128K tokens 和 350 images per episode,属于多模态长交互压力测试。
  • GPT-5.4 在 10x10 图像 Matching Pairs 单模型设置下达到 62.3%,Gemini-3.1-Pro 在 13x13 3D Maze 上达到 50.0% SR。
  • Duel protocol 中 Gemini-3.1-Pro 赢下所有 matchup,说明单模型成绩和对战式共享观察利用能力可能排序不同。
  • Memory Gap 通过 oracle hidden state 注入区分遗忘和动作选择,实验显示大量残差错误来自隐藏状态维护失败。
  • 文本到图像的性能下降说明视觉身份绑定是重要瓶颈,记忆和感知在多模态交互中高度耦合。
  • Qwen3.5-9B 的 SFT 实验显示,加入过滤后的模型成功 rollouts 比只用最优轨迹更有效,Match Score 从 14.6 提升到 29.5。
  • 论文局限在于环境类型有限、Memory Gap 不是严格因果分解、训练实验只覆盖一个基座模型。

参考资料