本页目录 Training Object Permanence in World Models

Training Object Permanence in World Models

深入解析 WROP 如何把发展心理学中的客体永久性与实体性转化为 150 个 Blender 任务、150 万训练样本和 300 题评测,并以 PWM-WROP 验证认知原则驱动的合成数据能否改善视频世界模型,同时审视同生成器评测、接口差异与人工 Elo 的证据边界。

自动研究时间:2026-09-26 09:01(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Sep 25,列表最顶部为 Training Object Permanence in World Models。1
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> arXiv v1 完整 PDF 与 TeX 源文件(26 页,含正文、5 张表、参考文献与附录)-> 官方项目页、数据与代码入口。本文不以列表摘要代替论文正文。

执行摘要

视频生成模型已经能产出逼真的运动,却仍会让遮挡后的球凭空消失、从错误位置重现,或穿过尺寸不匹配的孔洞。论文认为,这些并非普通的画面瑕疵,而是世界模型缺失两类基础物理先验的表现:客体永久性要求物体在不可见期间仍保持身份、数量与位置连续性,客体实体性要求固体不能互相穿透,接触、支撑移除和碰撞应产生相应后果。若模型连这两层约束都不稳定,更高层的碰撞、因果与规划也会继承错误。2

作者提出 WROP(World Reasoning with Object Permanence),以 150 个手工设计的 Blender 生成器构造六类任务:动态遮挡、静态场景遮挡、容器永久性、障碍阻挡、支撑移除和物体碰撞。每个生成器产生 10,000 个样本,总计 150 万条训练数据;每条样本由 60 帧输入、60 帧目标、提示词、逐帧轨迹和场景元数据组成。另有固定 300 题考试,每个生成器抽取两题。任务的关键物理事件被放在时间中点之后,使模型必须根据前半段继续生成后果,而不能只描述已经发生的事件。2

为了回答“这种能力能否被教会”,作者在 Cosmos3-Nano 上以相同视频续写协议微调一个 16B 模型 PWM-WROP。它在 20 位评审参与的盲配对实验中得到 1679.5 Elo,位列 14 个系统第三,并以 224 Elo 领先下一名真正的视频续写模型;在统一缩放到 320×192 后,它也取得最佳 LPIPS、MS-SSIM 和 MSE。结果说明,针对认知原则设计的程序化数据确实可能修补视频模型的特定物理缺口。2

但“第三名”不能被直接解释成通用世界模型已经逼近前沿:前两名是可以重绘完整事件的 reference-to-video 系统,不受严格续写边界约束;PWM-WROP 的 95% 置信区间与前两名明显重叠;人工 Elo 只来自 361 次跨模型判断,而不是 14 个模型在 300 题上的完整两两评审。更关键的是,训练集和考试来自同一批 150 个生成器,只是随机参数不同,因此论文强有力地证明了同任务族内的可训练性,却尚未证明对未见物体、真实视频、复杂接触动力学或新物理机制的系统泛化。

这项工作的真正价值,是把模糊的“视频模型是否懂物理”转化成可控、可训练、可复现的问题:先用认知科学确定能力单元,再用程序生成器隔离结构变量与视觉干扰,最后把人类判断和目标视频指标组合起来。它提供了一条比无差别扩充网络视频更可诊断的数据工程路线,也清楚暴露了下一步必须解决的分布外评测、动力学真实性与接口公平性问题。

1. 论文基本信息

项目内容
论文标题Training Object Permanence in World Models
论文编号arXiv:2609.28654
当前版本v1,2026-09-23 提交,共 26 页、9 幅图、5 张表3
Daily Papers 状态2026-09-25 列表榜首,Hugging Face 当日第 11
作者Haotian Zhang、Fengyuan Yu、Dezhi Luo、Haoran Sun、Zehong Zhao 等 31 人
主要机构USC、CMU、University of Michigan、Johns Hopkins、Columbia、Stanford、Harvard、Oxford 等
研究方向世界模型、视频生成、直觉物理、认知科学、合成数据
数据规模150 个生成器、150 万训练样本、300 题固定考试
训练模型PWM-WROP,基于 16B Cosmos3-Nano 微调
评测范围14 个视频模型,分为续写、参考生视频、编辑/迁移三类

核心链接:

论文公开数据、固定考试、各模型生成结果、评分、模型权重以及面向 AWS Trainium2 的原生 PyTorch 训练栈,因而研究对象不只是一张排行榜,而是一套可继续扩展的数据与评测基础设施。14

2. 背景与动机:画面连贯不等于对象持续存在

2.1 两个最基础的物理约束

发展心理学把客体永久性(Object Permanence, OP)与客体实体性(Object Solidity, OS)视为核心知识的一部分:婴儿很早就会期待被挡住的物体仍然存在,也会对物体穿过固体障碍、失去支撑却悬空等不可能事件产生反应。论文借用的不是婴儿实验本身,而是其中“只改变一个决定性物理变量”的任务设计原则。2

  • 客体永久性:物体暂时不可见时,身份、数量、属性和位置关系仍应延续;容器移动时,隐藏物体的位置还要随参考系更新。
  • 客体实体性:固体不能占据同一空间;孔洞大小决定能否通过,支撑移除应触发下落,碰撞应保持数量并传递运动。

视频模型常能生成局部上合理的纹理和动作,却没有显式保持“什么东西仍然存在、它在哪里、接触后应该怎样运动”的状态。于是视觉质量指标可能很高,核心物理关系仍然错误。

2.2 既有视频推理评测的缺口

论文将既有工作的问题归纳为三类:许多任务局限于二维环境;大量评测只覆盖 image-to-video,而不测试从一段视频继续生成的 V2V 场景;训练数据规模小,且常让 VLM 自动判分。最后一点在直觉物理中尤其危险,因为判分模型本身也可能缺少相同的核心知识。

因此,WROP 的目标不是再做一个泛视频质量榜,而是建立一套满足四个条件的实验环境:能力定义来自认知科学,场景结构可精确控制,既能训练也能考试,并以人类盲评作为主要结果。

3. 核心贡献

3.1 从认知概念到可执行生成器

作者不是先批量生成视频再贴“物理”标签,而是为每个任务手工编写独立 Blender 生成器。结构参数控制对象数、轨迹、遮挡时长、孔洞比例、接触时机等认知难度;表面参数独立随机化颜色、材质、光照与相机。这种分离试图避免模型用外观捷径代替物理推断。

3.2 训练与评测共享同一个续写契约

每条视频在关键事件开始处附近一分为二:前半段建立场景,后半段呈现遮挡后的重现、通过或阻挡、下落、碰撞等后果。训练时输入前半段并预测后半段,考试也使用相同协议。这样监督信号直接落在需要物理判断的帧上。

3.3 WROP 数据、考试与开放模型

WROP 不只提供 300 题 benchmark,还提供 150 万条训练语料和 PWM-WROP 权重。与只诊断失败的评测不同,它允许研究者直接检验“定向数据能否把能力训练进去”。

3.4 人类偏好与目标拟合的双重评测

人工盲评关注提示词一致性、运动与物理合理性、对象是否消失/穿透/变形;自动指标则比较生成视频与手写目标视频的像素、结构、感知和语义相似度。两类结果回答不同问题,论文明确不把参考视频指标当作物理推理的直接分数。

3.5 可复现的 Trainium2 训练栈

作者还发布 PWM:在 AWS Trainium2 上运行 Cosmos3-Nano 的原生 PyTorch 训练实现。36 层模型以 tensor parallel 4 × FSDP2 16 分布到 64 个 NeuronCore,并通过通信与优化器改造把 batch 16 的单步时间从 15.1 秒降至 5.71 秒。这个基础设施贡献与认知任务本身相对独立,但降低了复现 16B 视频模型微调的工程门槛。2

4. WROP 方法:六类任务怎样隔离物理能力

4.1 六个认知任务族

维度任务族生成器数模型必须维持的约束
OP-1动态遮挡26运动物体经过完全遮挡后,以相同身份、大小和方向重现
OP-2静态场景遮挡29遮挡物移开后,对象数量、身份和空间排列保持不变
OP-3容器永久性35容器移动、旋转或交换后,隐藏物体随所属容器更新位置
OS-1障碍阻挡20根据物体与孔洞的尺寸关系决定通过、停止或偏转
OS-2支撑移除21支撑消失后及时下落,并依据下层孔洞尺寸决定继续落下或停住
OS-3物体碰撞19接触后传递运动,同时保持对象身份、数量和分离轨迹

90 个生成器测试 OP,60 个测试 OS。任务包括三球穿过平行隧道、屏风遮住静态物体、杯子随转盘交换位置、尺寸门、抽走支撑板和台球开球等。附录逐项列出 150 个生成器,使每个失败都能回到明确的物理情景,而不是只得到一个总分。2

4.2 一条样本包含什么

每个生成器贡献 10,000 条训练样本。每条原始动画为 1280×720、24 fps、120 帧,打包为五部分:

  1. 60 帧输入视频;
  2. 60 帧目标视频;
  3. 自然语言提示;
  4. 对象逐帧位姿轨迹;
  5. 包含生成器、样本序号、随机种子与渲染配置的元数据。

动画使用 Blender 4.4.3 与 EEVEE Next 渲染,但运动由作者用关键帧和解析轨迹编排,并未使用刚体物理引擎。这能精确控制事件发生帧,代价是数据表达的是“作者认为正确的运动”,而不是由统一动力学定律自然涌现的结果。

4.3 结构变化与视觉变化分开

WROP 的生成器有两组参数:

  • 结构参数改变真正的问题,例如对象数量、轨道拓扑、遮挡配置、孔洞大小、接触时间和碰撞几何;
  • 表面参数只改变颜色、材质、灯光和视角,不改变物理结论。

这个设计比单纯做颜色增强更重要。若每个生成器永远对应同一个结局,模型可能记住模板;WROP 会在同一生成器内改变结构难度和多个合法结果。例如带标记的盒子交换位置后,模型必须追踪“哪个盒子装了哪个物体”,而不能按最终屏幕位置猜答案。

4.4 数据质量控制

流水线会重试并记录渲染失败,自动检查五类文件是否齐全、两段视频是否都是 60 帧、帧率和切分点是否一致,以及轨迹和元数据字段是否完整。发布前还人工抽查每个生成器的代表样本。自动检查覆盖了格式和可追踪性,但论文没有报告对 150 万样本物理正确率的随机抽样统计,这仍是大规模手写生成器的数据风险。

5. PWM-WROP:把物理事件放进预测区间

5.1 模型与训练目标

PWM-WROP 从 16B Cosmos3-Nano 微调而来,不改架构和 tokenizer,只改变训练信号。模型接收样本前半段及原始提示,预测包含关键事件与后果的后半段,不使用任务类别或任务族标签。训练进行一个 epoch,覆盖 150 万样本的早期渲染版本;论文称 PWM-WROP 是所有被测模型中唯一在 WROP 数据上训练过的系统。2

实际训练几何为 320×192 的 117 帧 packed clip:57 帧条件视频加 60 帧预测视频。推理采用 UniPC 35 步、guidance 6.0、shift 10.0 与固定随机种子。对少量 90 帧输入题,模型只能看到最后 57 帧,前 33 帧被截断,这是解释长时间依赖结果时必须保留的条件。

5.2 三类接口并不做同一件事

评测的 14 个模型分为三组:

接口类型数量代表模型与输入视频的关系
True continuation4PWM-WROP、MAGI-1 24B、LTX-2.3 Extend、Grok Imagine把输入当作时间前缀,生成后续帧
Reference-to-video3Seedance 2.5、Wan 3.0 Prime、MiniMax H3把输入当视觉参考,从自己的时间线重绘事件
Edit / transfer7Wan-VACE、HY-OmniWeaving、Cosmos3 Super、Kling O3 Pro 等在输入所在时间段逐帧重绘或迁移

统一 harness 向所有模型原样发送输入视频和提示词,不暴露目标视频,也不做针对模型的提示工程。输出经过解码与几何检查;拼接或填充了原视频的服务会先裁去前缀,再进入评测。

“统一输入”并没有消除任务定义差异。续写模型必须从最后一帧无缝接上;参考生视频模型可以重新安排场景与时间;编辑模型甚至未必能自然表示切分点之后才发生的事件。因此论文把接口类型作为显式分析因素,但总榜仍然把三类系统排在一起。

6. 评测设计

6.1 人工盲配对是主指标

20 位众包评审先通过 10 题资格测试,门槛为 8/10,中位成绩为 9/10。评审看到输入视频、提示词和匿名随机排序的两个候选续写,可选 A、B 或“差不多”,共同判断:

  • 是否符合文本描述;
  • 运动是否自然、物理是否合理;
  • 对象是否在遮挡后消失、凭空出现、穿透障碍,或改变颜色、形状和数量。

所有候选先归一化到 1280×720、24 fps、静音和统一码率。120 个模型对各安排 4 个 benchmark item,计划 480 次、实际完成 476 次判断;去掉同模型比较等项后,主分析使用 361 次跨模型判断,每个模型仅有 50–52 场。Bradley–Terry 模型将胜负和各计半分的平局转换为均值 1500 的 Elo,并按评审聚类进行 1,000 次 bootstrap。2

质量控制结果较好:注意力检查正确率 90.0%,重复题自洽率 93.5%,Cohen’s κ=0.891;非平局中左侧视频被选比例为 51.4%,未发现显著位置偏差。不过每个模型对只看约四个题目,Elo 的覆盖密度仍然有限。

6.2 自动指标只衡量目标拟合

所有预测跨度被重采样到目标帧数,并缩放为最低原生分辨率 320×192,再计算 MSE、MAE、PSNR、SSIM、MS-SSIM、LPIPS、时序差分、CLIP、FID 与末帧指标。它们回答“生成结果与唯一参考视频多像”,而不是“物理原则是否正确”。

例如,一个编辑模型只要忠实重绘事件前的静态场景,就可能获得不错的 SSIM;一个物理结论正确的续写模型若碰撞时机与参考相差几帧,像素误差仍会很高。因此自动指标适合诊断外观和几何一致性,不适合替代人工物理判分。

7. 主要实验结果

7.1 人工 Elo:定向微调后的续写模型明显领先同类

排名模型接口类型Elo95% CI原始得分率
1Wan 3.0 PrimeReference-to-video1723.6[1629.2, 1864.9]77.9%
2MiniMax H3Reference-to-video1723.6[1644.5, 1837.6]77.9%
3PWM-WROPTrue continuation1679.5[1603.5, 1781.5]73.1%
4Seedance 2.5Reference-to-video1649.6[1554.2, 1751.5]69.6%
5Runway Aleph 2Edit / transfer1518.3[1425.1, 1621.6]52.9%
9Grok ImagineTrue continuation1457.0[1362.7, 1555.1]44.2%
10LTX-2.3 ExtendTrue continuation1453.4[1363.6, 1545.8]43.1%
14MAGI-1 24BTrue continuation1248.0[1137.2, 1315.6]19.2%

按表中精确数值,PWM-WROP 比下一名续写模型高 222.5 Elo;论文正文将这一差距概括为 224 Elo。这是最有说服力的系统级结果:一个低分辨率开放模型经过同协议的定向训练后,在严格续写组中建立明显优势。

但它与前两名的置信区间重叠,不能宣称差异具有统计显著性。Bootstrap 的第一名概率分别为 Wan 46.8%、MiniMax 36.4%、PWM-WROP 12.3%、Seedance 4.5%;其余模型为 0。更稳妥的结论是 PWM-WROP 属于顶部四模型群,并在 true-continuation 子组中排名第一。

7.2 不同物理能力的提升不均匀

PWM-WROP 在六个任务族中的名次为:

任务族名次解释
OP-1 动态遮挡3能较好保持运动物体身份与轨迹
OP-2 静态场景遮挡1最强项,能在遮挡移开后恢复原布局
OP-3 容器永久性3能跟踪容器与隐藏物体的绑定关系
OS-1 障碍阻挡5尺寸与障碍约束仍不稳定
OS-2 支撑移除2能较好连接支撑消失与下落
OS-3 物体碰撞8最弱项,复杂接触与多体轨迹仍困难

这表明“记住被挡住的对象”和“生成正确接触动力学”不是同一种能力。前者更像持续状态表示,后者还要求估计几何、动量传递和多体因果。论文的微调对 OP 更稳定,对碰撞的帮助有限。

各任务族的判断数只有 36–96 场,其中 OS 各族仅 36–44 场,置信区间很宽。因此单个名次只应视为趋势,不能把 OP-2 第一与 OS-3 第八解读成精确能力刻度。

7.3 典型失败分成两类

论文用六个生成器进行同样本质性比较,揭示两种反复出现的错误:

  1. 表示掉线(representation dropout):三颗球离开隧道时车道或数量改变;遮挡移开后对象从空处突然生成;杯子交换位置后,球出现在错误的杯子下;碰撞前后对象增减。
  2. 因果脱钩(causal decoupling):球面对过小孔洞仍继续穿过;支撑结构消失后球悬停数帧;碰撞看起来热闹,却没有保持对象数量和动量结果。

这一区分很有工程价值:前一类更可能需要持久对象表示与身份跟踪,后一类则需要显式建模条件事件与动力学后果。只增加视频清晰度或 temporal consistency loss 未必同时修复两者。

7.4 自动指标支持目标拟合,但与 Elo 不是同一排序

在 320×192 的统一尺度上:

模型LPIPS ↓MS-SSIM ↑SSIM ↑MSE ×10⁻³ ↓CLIP ↑FID ↓
PWM-WROP0.0810.9210.9172.970.95620.4
MiniMax H30.1050.8770.9389.090.96214.8
Wan 3.0 Prime0.1150.8610.9424.480.94815.1
Grok Imagine0.1250.8520.9325.520.95613.6

PWM-WROP 在 LPIPS、MS-SSIM、MSE、MAE 和末帧 MSE 上最好,CLIP 第二;但 SSIM、PSNR 与 FID 并非最佳。尤其是 FID 和 720p 末帧指标会惩罚它把 320×192 原生输出放大到高分辨率的过程。合理结论是低原生分辨率没有阻止它在同尺度下贴近目标,不能据此宣称视觉质量全面领先 720p/1080p 系统。

8. 与相关工作的关系

8.1 从“视频生成”转向“视频世界模型”

扩散模型、DiT 与 Sora、Veo、Kling、Wan、HunyuanVideo、LTX 等系统推动了视频的感知质量。近期 VideoWorldBench、VRBench、RulerBench 等工作开始测迷宫、时序规律和抽象规则。WROP 的差异在于把测试范围收窄到两个发展心理学定义清晰的核心约束,并把 benchmark 与大规模训练集绑定起来。

8.2 与直觉物理 benchmark 的差别

传统直觉物理评测常让模型在两个结果中识别“不可能事件”,或用分类、问答和 VLM judge 打分。WROP 要求模型逐帧生成物理上可行的后半段,难度高于识别已有错误;同时用人类盲评规避“让另一个同样不懂物理的模型来裁判”的循环。

8.3 程序化合成数据的再评价

WROP 延续了 CLEVR 一类程序化数据的核心思想:用可控生成过程换取变量可解释性。但它把对象从静态图像扩展到 3D 时序事件,并把数据量扩到可用于 16B 视频模型微调的 150 万条。其局限也与程序化数据一致:任务空间由作者预先枚举,模型可能学会生成器分布,而非形成可迁移的物理规律。

9. 局限与批判性分析

9.1 训练与考试没有在生成器层面隔离

固定考试的 300 题来自训练所用的同一批 150 个生成器,每个生成器抽两题。尽管随机种子、结构参数和表面参数不同,模型仍可能学习每个脚本家族的视觉语法、事件模板和典型结局。要证明组合泛化,至少需要按生成器、对象资产、场景风格乃至任务机制做完全留出评测。

9.2 150 万样本不等于 150 万种物理结构

每个生成器扩增到 10,000 条,规模优势主要来自参数化变化。若大量变化只是材质、灯光和相机,数据的有效结构多样性更接近 150 个程序,而不是 150 万个独立问题。论文没有给出结构参数组合的覆盖率、难度分布或重复度分析。

9.3 缺少同基座的关键消融

最直接的因果比较应是未微调的 Cosmos3-Nano 与 PWM-WROP 使用完全相同推理设置在 WROP 上对比。当前总榜中的 Cosmos3 Super 属于 edit/transfer 接口,并非同基座、同接口的控制组。PWM-WROP 与其他续写模型的差距同时混合了架构、预训练、参数规模、采样器和微调数据,因而不能把 224 Elo 全部归因于 WROP 训练。

9.4 接口差异造成排行榜的结构性混杂

参考生视频模型可以从头重绘场景,编辑模型操作的是原时间段,真正续写模型必须承接最后一帧。它们对身份保持、时间连续性和事件覆盖的约束不同。分组报告缓解了问题,但总 Elo 仍不是完全同质的能力比较;更公平的设计应分别维护三张榜,或只比较能满足相同因果契约的系统。

9.5 人工评测稀疏,且把多个标准合成一个偏好

361 次有效跨模型判断分摊到 14 个模型和 120 个模型对,每个模型对约四题,远少于对完整 300 题进行密集评价。评审还被要求同时考虑提示一致性、自然运动、物理合理性和客体永久性,一个选择无法区分“物理更对但画质更差”与“画质更好但物理略错”。后续应增加每题覆盖,并把身份、数量、位置、穿透、接触时机等拆成独立标签。

9.6 手写关键帧不是真实动力学

不用物理引擎让事件边界更可控,也避免模拟器偶然误差,但碰撞、摩擦、弹性、旋转和支撑关系由脚本作者决定。模型可能学到视觉化的因果故事,却未必能适应真实世界中连续、噪声化、参数未知的动力学。OS-3 只排第八也提示复杂接触不能靠当前数据设计轻易解决。

9.7 自动指标与物理正确性仍未建立可靠映射

唯一参考轨迹不是唯一合法物理解。正确生成可能因速度、碰撞时刻或停止位置略有不同而被 LPIPS/MSE 惩罚;错误编辑也可能因保留纹理而得高分。WROP 已经意识到这一点,但尚未提供基于轨迹、对象检测、约束违反或多合法解的自动物理指标,导致规模化评测仍依赖昂贵人类判断。

9.8 真实视频与开放世界迁移尚未验证

全部任务都是干净的 Blender 场景,物体边界、遮挡关系和镜头运动都受控。真实视频还包含运动模糊、材质透明、非刚体、相机抖动、部分可观察、多物体长期互动和语义歧义。论文结果不能直接外推到机器人预测、自动驾驶或真实环境规划。

10. 应用影响

10.1 对视频模型训练的启示

WROP 展示了一种“能力单元 -> 生成器 -> 训练集 -> 固定考试”的闭环。团队无需等待互联网数据恰好覆盖稀有物理事件,可以围绕已知故障主动生成课程,并把关键事件放在预测区间。适合扩展的方向包括液体守恒、铰链与关节、摩擦、弹性形变、工具使用和多步因果链。

10.2 对机器人世界模型的启示

机器人规划要求隐藏物体仍在、障碍不可穿透、支撑变化会改变可行动作。WROP 可以作为视觉预测模型的预训练或单元测试数据,但在用于控制前还需引入动作条件、传感器噪声、真实动力学参数和闭环交互,否则模型只会“画出”正确事件,未必能据此选择动作。

10.3 对评测工程的启示

论文提醒评测设计者显式区分接口契约。reference-to-video、video continuation 与 editing 即使都接受视频输入,也不是同一任务。若产品需要无缝续写,就不应因为重绘模型的画面更漂亮而将其视为等价替代。

10.4 对合成数据治理的启示

可追踪的随机种子、生成器 ID、轨迹和场景元数据,使失败可以定位到具体程序与参数组合。真正部署时还应补充生成器级数据卡、结构覆盖统计、人工抽检比例、已知错误和版本差异,避免“样本数很大”掩盖结构单一或脚本缺陷。

11. 下一步值得做的实验

  1. 同基座消融:比较 Cosmos3-Nano 原模型、只用等量普通视频微调、只用 OP、只用 OS 和完整 WROP,隔离数据贡献。
  2. 生成器留出:按完整生成器或物理机制划分训练/测试,验证未见任务结构,而不只是未见随机种子。
  3. 真实视频迁移:把模型放到遮挡、容器移动、支撑移除和碰撞的实拍集上,测零样本与少样本迁移。
  4. 对象级自动判分:利用轨迹、分割和跟踪器直接测身份保持、计数、穿透、碰撞时刻与末状态,并允许多条合法轨迹。
  5. 接口内完整评测:为每种接口单独建立密集榜,在更多题上做人类或对象级判断,减少四题模型对造成的高方差。
  6. 课程与组合泛化:先学永久性,再学支撑与碰撞,最后组合成多事件长视频,检验基础约束能否成为更高层因果推理的脚手架。
  7. 闭环控制验证:将生成模型嵌入机器人或交互环境,观察更好的视频物理是否真的提高规划成功率,而不只改善观看偏好。

12. 结论

WROP 的贡献不在于证明视频模型已经获得人类式物理智能,而在于给“最基础的物理常识能否被训练”提供了一个结构清晰的实验答案。150 个认知任务生成器、150 万训练样本、300 题固定考试、14 模型评测与开放训练栈共同表明:针对客体永久性和实体性设计的合成数据,能够显著改善同任务分布中的视频续写表现。

PWM-WROP 在真正续写模型中排名第一,在整体 Elo 中进入顶部群,并以很低的原生分辨率获得强目标拟合,这是值得重视的证据。但训练与测试共享生成器、缺少同基座控制、接口不一致、人工样本稀疏和真实世界缺席,使结论必须停留在“可训练性初证”,而不是“通用物理推理已解决”。

对世界模型研究者而言,最可复用的思想是:不要把物理能力当成一个不可分的总分。把对象持续表示、空间约束、支撑依赖与接触动力学拆开,为每种能力构造可控制、可追踪、可留出的数据,再逐层检验它们能否组合成开放世界中的预测与行动能力。

参考资料

Footnotes

  1. Hugging Face, Daily Papers(2026-09-25 页面);Training Object Permanence in World Models 详情页。 ↩ ↩2 ↩3

  2. Zhang, H. et al., Training Object Permanence in World Models, arXiv:2609.28654v1,正文、表格与附录,包括 WROP taxonomy、训练协议、人类 Elo、自动指标和 Trainium2 工程记录。 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8

  3. arXiv, Training Object Permanence in World Models 摘要页,v1 submitted 23 Sep 2026;PDF。 ↩

  4. WROP 官方资源:项目页;代码仓库;训练数据;评测集;PWM-WROP 模型。 ↩