ABot-World-0
基于 Hugging Face Daily Papers 2026-07-22 榜首论文,深入解读 ABot-World-0 如何以多源交互数据、LongForcing 长程蒸馏与低比特流式推理,让 5B 视频世界模型在单张 RTX 5090 上实现可控、长时、实时的 720P 世界生成。
自动研究时间:2026-07-23 09:01(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Jul 22,列表最顶部为 ABot-World-0;详情页标注#1 Paper of the day。
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> arXiv PDF 与完整 TeX 源码 -> 项目页、模型页及开源仓库交叉核对。
执行摘要
视频生成模型已经能合成数秒到数十秒的逼真片段,但“世界模型”要求更高:用户每次输入动作后,系统都要及时给出响应;生成结果还会成为下一步输入,因此任何身份、几何或运动误差都会在闭环中累积。真正可用的交互世界不能只在离线短视频上看起来合理,还必须同时处理可控性、长程稳定、首帧延迟、持续吞吐与显存预算。
ABot-World-0 是阿里巴巴高德地图 AMAP CV Lab 推出的 5B action-conditioned video world model。它以 W/A/S/D 表示角色或相机平移,以 I/J/K/L 表示相机转动,让场景漫游和第三人称角色控制共享同一套键盘动作接口;角色参考图则作为长期身份记忆。模型先在 AAA 游戏、仿真引擎和互联网视频组成的多源数据上训练双向教师,再依次经过 teacher forcing、ODE distillation 和 LongForcing,转化为能分块自回归生成的少步因果学生。
论文最值得关注的并非单个新网络模块,而是完整系统的协同设计。LongForcing 让扩展时域教师监督学生自己生成的长轨迹,直接针对闭环推理中的分布偏移;部署侧再组合 LightVAE、SageAttention2、Fast-RoPE、有界 KV cache、模块调度和低比特 DiT。在单张 NVIDIA RTX 5090、1280×704、batch size 1 下,最高吞吐配置达到 15.831 FPS;论文把整体工作区间概括为最高 16 FPS、1.2 秒 action-to-first-frame latency、优化配置峰值显存不超过 19.3 GiB。
但“infinite”应理解为架构上不受固定视频长度限制,而不是已经严格证明无限时间稳定。WorldRoamBench 给出了有竞争力但并非全面第一的结果;LongForcing 的直接量化消融只有 60 秒,小时级和天级 rollout 主要以抽样关键帧展示。论文还没有公开语料总规模、训练预算及完整长程人评。它更像一份很强的端到端工程证据:高质量交互视频模型可以在消费级旗舰 GPU 上进入接近实时的运行区间,但距离可验证、可预测的通用模拟器仍有明显距离。
1. 论文基本信息
| 项目 | 内容 |
|---|---|
| 论文标题 | ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU |
| 论文编号 | arXiv:2607.19191 |
| arXiv 版本 | v1,2026-07-21 提交 |
| Hugging Face 状态 | 2026-07-22 Daily Papers 榜首,#1 Paper of the day |
| 作者 | Fan Jiang 等 41 位作者,以 ABot-World Team 形式协作 |
| 机构 | AMAP CV Lab,Alibaba Group |
| 学科分类 | Computer Vision and Pattern Recognition(cs.CV),同时归入 cs.AI、cs.LG |
| 模型 | ABot-World-0-5B-LF,基于 Wan2.2 视频生成主干 |
| 输出与硬件 | 1280×704,单张 NVIDIA RTX 5090,最高约 16 FPS |
| 开放资源 | 5B 因果学生权重、推理代码、本地 Gradio 演示与在线 Space 已开放;代码与模型标注 Apache-2.0 |
核心链接:
- Hugging Face 论文页:https://huggingface.co/papers/2607.19191
- arXiv 摘要页:https://arxiv.org/abs/2607.19191
- arXiv HTML 全文:https://arxiv.org/html/2607.19191
- arXiv PDF:https://arxiv.org/pdf/2607.19191
- 项目页:https://abot-world.amap.com/
- 代码仓库:https://github.com/amap-cvlab/ABot-World
- Hugging Face 模型:https://huggingface.co/acvlab/ABot-World-0-5B-LF
- 在线交互 Space:https://huggingface.co/spaces/acvlab/abot-world-interactive
2. 背景与动机:从“生成视频”到“持续运行的世界”
2.1 闭环交互改变了问题定义
普通视频生成可以一次看到整个目标片段,重点是画面质量和短期时序一致性。交互世界模型则要持续计算:给定历史画面、未来一小段动作和文本或参考图条件,预测下一段视频,再把这段视频接回历史继续生成。论文将其写为:
这里的关键不是公式本身,而是生成分布会反过来改变下一步的条件。短视频里一个不起眼的纹理错误,经过几十次自回归后可能变成身份漂移、运动冻结、重复图案或几何崩坏。这就是世界模型的 exposure bias:训练常看到真实历史,部署却只能看到自己生成的历史。
2.2 四个瓶颈相互牵制
| 瓶颈 | 典型问题 | 单点优化为何不够 |
|---|---|---|
| 数据 | 互联网视频丰富却没有动作;游戏有动作却风格有限;仿真可控但轨迹容易单一 | 任何单一来源都无法同时覆盖真实感、控制精度和多样性 |
| 控制 | 相机轨迹、角色动作、视角变化常使用不同接口 | 复杂或无界的控制表示难以在长 rollout 中保持训练分布内行为 |
| 稳定 | 自回归误差不断进入后续上下文 | 只优化单步或短片段质量不能约束长程生成分布 |
| 部署 | 少步 DiT 仍受 VAE、attention、KV cache 和模块驻留限制 | 减少 denoising step 不等于系统能实时运行 |
ABot-World-0 的设计逻辑,是让数据、模型目标、控制接口和推理栈共同围绕闭环约束收敛,而不是把一个视频生成模型简单套进键盘控制器。
3. 核心贡献
3.1 WorldExplorer:训练反馈驱动的数据生产闭环
训练语料来自三种互补来源:
- AAA 游戏提供高画质环境、第一与第三人称视角,以及由运行时 API 直接获取的精确动作和相机状态,是最可靠的动作监督来源。
- Unreal Engine 与 ABot-3DGS 仿真提供可设计轨迹、碰撞检查和几何控制;其中部分 3DGS 场景来自非公开的街景航拍、街扫等资产。
- 互联网视频补充真实光照、自然相机运动和跨域外观,但其 6-DoF 位姿与动作只能由估计得到,标签噪声更高。
WorldExplorer 并非固定脚本录屏。导航代理先优先探索未覆盖区域,再放宽到邻近搜索,最后退化为带碰撞检测的前进策略;任务模板控制地理、天气、时段、交通密度、视角与载具等维度。训练监控模块再定位表现较差的“场景—动作”组合,动态提高相应采集比例,同时保留最低覆盖率以避免遗忘。
采集时,视频帧、相机位置与旋转、FOV、控制输入、环境状态和元数据用毫秒时间戳同步。论文报告在 30 FPS 下跨模态对齐误差低于 33 ms。所有来源随后经过六个质量维度上的 14 项确定性检查,并辅以 VLM 语义审查,覆盖文件完整性、视觉有效性、几何一致性、游戏状态、动作对齐和元数据质量。
这套基础设施的真正价值是把“数据集”变成持续响应模型弱点的生产系统。不过,论文没有披露三类来源的最终样本比例、总训练时长、过滤通过率和反馈重采样带来的独立增益,因此目前更能确认设计完整性,尚难量化每个数据环节的边际贡献。
3.2 有界的统一动作空间
每帧动作是 8 维 multi-hot 向量:W/A/S/D 控制移动,I/J/K/L 控制相机旋转。连续四帧动作按通道拼接为 32 维 token,与 VAE 的 4 倍时间压缩对齐;Action Control Adapter 再将控制特征直接加到 DiT patch embedding。
这种表示牺牲了连续 6-DoF 轨迹的精细度,却获得三项实用优势:用户键盘输入天然可用;场景漫游和角色控制共用接口;动作始终处于固定、局部、有限的空间,不会像累计全局位姿那样逐渐走出训练范围。对长程交互而言,“控制表示是否有界”可能比“单步描述是否最精确”更重要。
第三人称模式还加入角色参考记忆。多张标准方向参考图经同一 VAE 编码为 identity-memory tokens,放在视频 token 前,并使用固定负时间 RoPE 位置。视频 token 可以读取记忆,记忆 token 却不被生成视频反向改写。这种非对称 attention 相当于给角色身份设置一个不会随 rollout 污染的只读锚点。
3.3 三阶段从双向教师转为因果学生
ABot-World-0 先全参数微调 Wan2.2 主干,得到能在完整时间范围内交换信息的双向 action-conditioned teacher。双向模型画面和运动先验强,却需要访问未来帧且要多步去噪,无法直接用于在线交互。因此作者逐级改变问题,而不是一次性同时追求因果、少步和长程稳定。
- Teacher forcing:学生由双向教师初始化,历史部分使用干净真实 latent,目标 chunk 加噪;causal attention mask 禁止访问未来。该阶段先把信息结构变成“只看过去预测未来”。
- Causal ODE distillation:冻结第一阶段因果扩散模型,让学生在相同历史、动作和多模态条件下,直接逼近 probability-flow ODE 从中间噪声状态到干净端点的映射,把多步去噪压缩为少步生成。
- LongForcing:让少步学生进行更长的自生成 rollout,再由扩展时域的双向教师在最终 DMD 阶段提供分布级监督。目标不是逐帧复制一条教师轨迹,而是把已经累积误差的学生分布拉回合理的长程世界动态。
前两阶段解决“能否因果生成”和“能否足够快”,第三阶段才处理“学生持续吃自己的输出后会发生什么”。这一区分很重要:局部转移准确并不自动保证闭环稳定,长程监督必须覆盖模型真实部署时访问的状态。
3.4 全栈推理协同设计
每个推理 chunk 包含 3 个 latent frames,解码后得到 12 个视频帧。由于一个 chunk 完整解码后才把第一帧交给流式运行时,action-to-first-frame latency 同时受 DiT 和 VAE 影响。作者据此组合六类优化:
- LightVAE:简化、剪枝视频解码器,降低解码时延与显存;
- SageAttention2:替换主要 attention kernel;
- FP8、MXFP6、MXFP4:量化 DiT 的计算密集线性层,VAE 与文本编码器保留较高精度;
- Fast-RoPE:在局部窗口内重新锚定时间 RoPE,并用 Triton kernel 加速;
- 有界 KV cache:滚动淘汰旧上下文,使 cache 大小不随总生成时长无限增长;
- 显存感知模块调度:按执行顺序装载组件,避免全部模块同时驻留 GPU。
这也揭示了系统指标中的一个权衡:chunk-wise 生成能摊薄 attention 和 VAE 成本、提高 FPS,却意味着新动作不能像逐帧生成那样立即影响下一帧。1.2 秒首帧延迟已经具有交互性,但对于强调即时操控的游戏仍明显高于传统渲染管线。
4. 实验结果
4.1 WorldRoamBench:优势集中在控制与视觉,不是全面第一
WorldRoamBench 从动作控制、视觉质量、物理一致性和时间记忆四个维度评价可控视频世界模型。论文只报告具体子维度,没有合成单一总分。
| 模型 | 规模 | Strict Acc. | Partial Acc. | Trajectory | Aesthetic | Imaging | Mechanics | Memory |
|---|---|---|---|---|---|---|---|---|
| Genie 3 | 未披露 | 0.4700 | 0.6608 | 0.6719 | 0.4711 | 0.4757 | 0.5454 | 0.6073 |
| HappyOyster | 未披露 | 0.5317 | 0.7631 | 0.7737 | 0.5235 | 0.4377 | 0.5395 | 0.6309 |
| LingBot-World | 14B | 0.3235 | 0.4198 | 0.4094 | 0.2898 | 0.2875 | 0.2777 | 0.3006 |
| HY-World 1.5 | 8.3B | 0.1640 | 0.2088 | 0.2015 | 0.1400 | 0.1236 | 0.1115 | 0.1562 |
| ABot-World-0 | 5B | 0.5266 | 0.7290 | 0.6752 | 0.5039 | 0.4651 | 0.5223 | 0.5041 |
ABot-World-0 在严格动作准确率、部分动作准确率、轨迹、美学和成像五项上都位居第二;5B 规模也明显超过表中的 14B LingBot-World 与 8.3B HY-World 1.5。另一方面,它的 Mechanics 和 Memory 只排第三,尤其 Memory 低于 Genie 3 和 HappyOyster。由于两个最强对手没有披露参数规模,表格也没有提供统一推理成本,不能把这些结果解读为严格同预算下的效率胜利。
4.2 LongForcing 消融:改善在 rollout 后半段扩大
作者将 LongForcing 与适配到同一交互模型的 Causal-Forcing-style baseline 比较。两者都使用学生自回归历史和最终 DMD,差别是 LongForcing 的教师监督覆盖更长时域。60 秒 rollout 逐帧测量四项指标:HPSv3 越高越好,高饱和像素比例、感知模糊和 patch repeat ratio 越低越好。
结果曲线显示,前半段差异有限,后半段逐渐扩大:基线的 HPSv3 持续下降,饱和、模糊和重复伪影上升;LongForcing 保持更高 HPSv3 和更低伪影指标。这与“误差随闭环步数累积、长教师应在后段产生更大价值”的机制预期相符。
不过,论文只给出曲线,没有表列终点数值、置信区间、样本量或统计显著性;消融也没有拆开学生自生成长度、教师时域长度和 DMD 权重。它支持 LongForcing 有效,但还不足以判断收益对不同训练配置是否稳定。
4.3 小时与天级 rollout:强压力测试,但主要是定性证据
论文展示五条小时级 rollout、四条天级 rollout 的时间戳关键帧,并给出跨域角色控制、纸箱碰撞、水迹、雪地脚印、墙面阻挡和栏杆碰撞等案例。抽样画面仍保持可识别场景、活动运动和角色一致性,没有明显退化为静态帧或纹理噪声。
这些案例说明模型至少能在部分选择的长轨迹上持续生成,且训练数据中学到了一些接触、遮挡与环境状态变化。但关键帧无法揭示两个采样点之间是否发生短暂崩坏、控制失败或不连续,也不能证明模型形成了显式物理状态。论文自己更谨慎地称其为“plausible physical responses”;把它上升为可靠物理模拟器会超出证据。
4.4 单卡实时性能来自组合优化
| 配置 | DiT 时间(ms/chunk) | VAE 时间(ms/chunk) | FPS | 峰值显存(GiB) |
|---|---|---|---|---|
| Base | 未完成 | 未完成 | OOM | OOM |
| + SageAttention2 | 未完成 | 未完成 | OOM | OOM |
| + SageAttention2 + LightVAE | 1191.081 | 78.276 | 9.117 | 20.491 |
| + LightVAE + FP8 | 845.180 | 75.980 | 12.405 | 15.925 |
| + FP8 + Fast-RoPE | 786.871 | 71.730 | 13.269 | 19.281 |
| + MXFP6 + Fast-RoPE | 718.281 | 85.994 | 14.098 | 18.287 |
| + MXFP4 + Fast-RoPE | 638.843 | 72.957 | 15.831 | 17.148 |
三个结论很明确:
- attention 加速不是充分条件:Base 和仅使用 SageAttention2 都 OOM,LightVAE 才让完整管线首次跑通。
- FP8 是质量导向默认点:相对 LightVAE 配置,DiT 时间下降约 29%,FPS 从 9.117 增至 12.405,同时峰值显存降至 15.925 GiB。
- “16 FPS”来自更激进量化:最高吞吐对应 MXFP4,而不是默认 FP8。论文没有在表中报告各精度的画质变化,因此 16 FPS 不应与默认质量点混为同一配置。
Fast-RoPE 版本的峰值显存从 FP8 的 15.925 GiB 回升到 19.281 GiB,也说明最终显存不是单个算子精度的单调函数,而取决于模块驻留、工作区和调度的完整组合。
5. 如何理解这篇论文的真正创新
5.1 LongForcing 处理的是“访问状态”而非单步误差
常规蒸馏要求学生在给定条件下模仿教师,但长程闭环的关键问题是学生随后会访问哪些条件。模型自己生成的历史逐渐偏离真实数据,只在真实或短期上下文上蒸馏,无法覆盖这些状态。LongForcing 先让学生走进自己的长程分布,再用扩展时域教师纠偏,更接近 imitation learning 中处理 covariate shift 的思路。
它与固定首帧、attention sink 或强锚定记忆也有不同取舍。后者能延缓身份漂移,却可能把世界锁在初始观察附近,限制场景继续演化;LongForcing 试图约束分布而不是固定具体画面,让模型在保持合理性的同时继续“想象”。
5.2 “实时世界模型”首先是系统指标,而非采样步数
论文最可迁移的工程洞见是:少步 diffusion 只会把瓶颈转移。DiT 变快后,VAE 解码、KV 读写、RoPE、模块驻留和首帧交付都会变得显著。因此评价交互模型应至少同时报告:
- action-to-first-frame latency,衡量按键后多久看到响应;
- sustained FPS,衡量长时间能否跟上播放;
- peak VRAM,衡量目标硬件能否实际运行;
- 精度对应的画质与控制退化,衡量速度是否由不可接受的量化损失换来。
ABot-World-0 报告了前三项,但第四项仍缺少量化对照。
5.3 有界局部动作适合持续交互,但限制表达能力
键盘 multi-hot 让控制简单、同步且始终处于固定集合,在训练和部署间几乎没有接口鸿沟。这可能是长 rollout 保持控制可靠性的关键原因之一。代价是它难以表达连续速度、精确姿态、手部操作或高层语义事件。作者也把更丰富的结构化动作列为未来方向。
6. 局限与审慎解读
6.1 论文与开放资源之间仍有缺口
截至本次抓取,开源仓库已经提供 5B 因果学生、推理代码和演示,项目公告计划开放 500 小时精确动作标注视频数据;但路线图中的双向教师和训练数据尚未完成开放。论文描述的完整训练语料还包含专有、非公开的街景航拍与街扫资产。
因此,外部研究者可以验证推理和部分性能,却暂时无法端到端复现 WorldExplorer 数据闭环、教师训练和 LongForcing 全流程。论文也没有报告训练 GPU 数量、总算力、数据总量与来源配比,这限制了成本评估。
6.2 “无限”与“天级稳定”缺少连续量化审计
有界 KV cache 使内存不随 rollout 长度增长,因而系统可以在架构上持续运行;但有限上下文也会丢弃远期细节。角色参考图能保存外观,不能自动保存所有场景状态、对象关系和过去事件。论文的 Memory 分数为 0.5041,低于两个最强对手,也提示长程状态保持仍是短板。
小时和天级案例没有连续控制准确率、轨迹偏差、身份相似度、事件记忆或失败率曲线。更严格的“无限世界”证据应报告多个随机种子、完整未剪辑轨迹、按时间分桶的指标与失败分布。
6.3 评测不能完全隔离数据与方法贡献
模型同时改变了数据来源、采集策略、质量控制、动作表示、身份记忆、训练流程和部署栈。WorldRoamBench 主结果没有逐项消融这些组件,LongForcing 消融也只聚焦视觉误差。因而当前无法确定性能提升中有多少来自多源数据、多少来自动作 adapter、多少来自蒸馏策略。
此外,游戏数据是最大来源但论文未列出具体游戏和授权范围;互联网视频使用位姿估计伪标签,可能带来系统性动作噪声;训练反馈驱动的重采样若缺乏约束,也可能让数据过度围绕现有 benchmark 弱点优化。
6.4 实时指标的适用范围有限
所有系统结果均来自单张 RTX 5090、batch size 1 和 1280×704。没有报告 RTX 4090、笔记本 GPU、数据中心 GPU 或不同分辨率下的缩放规律。MXFP4 的 15.831 FPS 是接近实时而非传统游戏意义上的高帧率,1.2 秒首帧延迟也更适合探索、创作和低频决策,不适合需要毫秒级反馈的竞技控制。
7. 应用影响
7.1 交互内容创作与原型设计
创作者可以用一张图或文本建立初始世界,再通过动作探索后续画面。相比预先生成固定视频,系统允许在观看过程中决定路径,适合概念预演、虚拟摄影、关卡气氛草图和交互叙事原型。当前延迟和物理可靠性决定了它更像生成式创作工具,而非可直接替换游戏引擎的运行时。
7.2 Agent 训练与策略评估
动作输入、视觉反馈和无限制 rollout 形式天然符合 agent-environment loop。低成本本地推理有机会扩大视觉 agent 的训练环境数量。但如果模型把不真实的碰撞、捷径或物体状态当成规律,agent 会利用模拟偏差。因此,在用于策略学习前,需要测量模型误差如何改变奖励与策略,而不仅是画面是否好看。
7.3 具身智能的视觉预测器
WorldExplorer 的精确动作—视频同步、多源轨迹和训练反馈重采样,可迁移到驾驶、机器人导航和数字孪生数据工程。ABot-World-0 本身仍使用离散键盘动作,也没有显式传感器、三维占据或力学状态,距离安全关键的具身预测器尚远。
7.4 本地与边缘部署
5B 模型在单张消费级旗舰 GPU 上运行,意味着交互世界不必完全依赖远程集群,可以降低视频上行、服务排队和隐私成本。与此同时,RTX 5090 仍属于高端硬件,峰值约 16–19 GiB 显存并不等于普通 PC 或移动设备可用;进一步轻量化需要同时保护画质、控制和长程稳定。
8. 与相关工作的关系
| 路线 | 代表工作 | ABot-World-0 的位置 |
|---|---|---|
| 可玩世界生成 | Genie、Genie 2/3、GameNGen、Oasis、WHAM | 延续从视频学习可交互环境的方向,强调原始键盘动作与本地单卡部署 |
| 通用与物理世界模型 | Cosmos、Runway GWM、Waymo World Model | 关注不同环境中的视觉动态,但 ABot-World-0 更偏开放世界漫游与角色控制 |
| 因果视频 diffusion | Diffusion Forcing、CausVid、Rolling Forcing | 采用 chunk-wise 因果生成,并以三阶段蒸馏从双向教师获得少步学生 |
| 自生成分布对齐 | Self-Forcing、LongLive、Causal Forcing、Context Forcing | LongForcing 把教师监督延伸到更长的学生自 rollout,针对后期分布漂移 |
| 长视频记忆 | Deep Forcing、MemRoPE、LongLive 2.0 | 使用有界局部 KV cache 和角色参考记忆,换取固定内存,但尚无通用持久场景记忆 |
| 实时视频系统 | MAGI、StreamDiT、MotionStream | 选择 chunk-wise 吞吐路线,并把 VAE、量化、attention、RoPE 与调度纳入同一部署目标 |
与很多只报告采样速度的工作相比,ABot-World-0 更完整地暴露了端到端系统成本;与强调长视频画质的工作相比,它又把动作响应和本地运行置于核心。其贡献不在于证明某个组件单独最优,而在于展示这些组件怎样共同跨过“能持续交互”的工程门槛。
9. 结论
ABot-World-0 提供了一条清晰的交互世界模型路线:用游戏、仿真和真实视频互补构造动作—视觉数据;以固定键盘动作降低长程控制分布漂移;用双向教师建立质量上限,再通过因果化、ODE 少步蒸馏和 LongForcing 分阶段解决在线生成;最后围绕首帧延迟、吞吐和显存做全栈优化。
实验支持三个稳健结论:5B 模型在 WorldRoamBench 的控制与视觉维度具有竞争力;LongForcing 在 60 秒 rollout 后半段减少了视觉误差累积;LightVAE 与低比特 DiT 等组合使 720P 单卡推理达到最高约 16 FPS。与此同时,数据和训练成本披露不足、长程证据以定性展示为主、物理与记忆仍不可靠,都说明它是“可交互生成器”的重要进展,而不是已经解决通用世界模拟。
最值得继续观察的不是模型能否生成更长视频,而是后续版本能否把长期状态变成可测量、可查询、可纠错的显式能力,并在更广泛硬件上同时守住控制、画质与响应速度。
参考资料
- ABot-World Team. ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU. arXiv:2607.19191, 2026.
- Hugging Face. ABot-World-0 Daily Papers 详情页.
- AMAP CV Lab. ABot-World 项目页.
- AMAP CV Lab. ABot-World 开源仓库.
- AMAP CV Lab. ABot-World-0-5B-LF 模型页.
- Xu et al. WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models.
- Wan Team. Wan2.2.
- Zhu et al. Causal Forcing.
- Zhang et al. SageAttention2: Efficient Attention with Thorough Outlier Smoothing and Per-thread INT4 Quantization.
- LightX2V Team. LightX2V.