Vidu S2
Vidu S2 硅基写手深入解析 Vidu S2 如何以 Self-Replay Forcing、帧对齐注意力、动态参考图像与系统级推理优化,将数字人生成和视频编辑推进到 720p、25–42 FPS 的实时流式范式;结合五组公开评测、人类偏好实验与空间视频案例,审视其证据边界、工程价值及部署风险。
自动研究时间:2026-09-16 09:02(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Sep 15,列表最顶部为 Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation。1
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> arXiv v1 完整 HTML 正文 -> 官方项目页。
执行摘要
传统视频生成是一种“提交 prompt、等待整段视频、得到一次性结果”的离线流程。Vidu S2 试图把它改造成持续运行的视觉系统:用户可以边说边控制数字人、在流中途上传新的物体或服装参考图,也可以把摄像头或已有视频连续变成另一种风格、人物、服装或背景。系统由两个模型组成:Vidu S2-Avatar 负责实时交互式数字人生成,Vidu S2-Editing 负责实时流式视频编辑;二者的输出还可转换成左右眼视图,用于空间视频展示。2
这项工作的技术主线不是单一模型结构创新,而是训练分布、因果生成、偏好优化和推理系统的协同设计。Avatar 先用双向图像/参考图生视频模型建立能力,再以 Teacher Forcing 与 Diffusion Forcing 混合训练切换到分块因果生成,最后通过 Self-Replay Forcing(SRF) 用模型自己的长程轨迹进行重加噪和可微重放。这样既让训练上下文接近推理时的自生成历史,又允许后段损失沿重放计算图影响前段表示。低分辨率主干负责动作和长程结构,单步 latent Refiner 恢复 720p 细节,在 25–42 FPS 下输出。3
Editing 则把源视频、可选参考图、编辑指令与目标视频 token 放入同一 DiT。其关键约束是帧对齐注意力:每个目标帧只读取同一时间点的源帧,避免源—目标时序错位;参考图对所有帧可见,以维持服装、人物、风格或背景的一致性。模型随后沿用混合 forcing 与 SRF 完成流式因果适配。推理侧再组合分层混合注意力、per-block W8A8 GEMM、Triton/CUDA kernel fusion、CUDA Graphs、多 GPU context parallelism 和跨模块时间调度,压低每个视频块的延迟。3
公开实验结果很强:Vidu S2-Avatar 在 StreamAV-Bench 的 9 个报告指标全部第一;Vidu S2-Editing 在 Sparkle-Bench 得到 3.74 Overall,在 OpenVE/RefVIE 联合评测得到 4.26 Joint Overall,并把 ViViD 无配对虚拟试衣的 VFID 降到 9.9515,明显低于 CatV²TON 的 19.5131。作者还报告了与商业系统的随机 GSB 人类偏好比较,以及 10 分钟级编辑稳定性测试。4
但“实时、可编辑、空间视频”三部分的证据强度并不相同。Avatar 与 Editing 有多组公开 benchmark 支持;空间视频主要是深度估计、视差 warp 与补洞组成的后处理管线,只展示左右眼定性案例,没有立体舒适度、深度精度、头动延迟或用户研究。论文也未充分披露模型参数量、训练计算、具体在线部署硬件、端到端语音至画面延迟和各加速模块消融。因此更准确的判断是:Vidu S2 给出了一个有竞争力的实时生成与编辑系统方案,但尚未提供足够信息让第三方复现其完整速度—质量—成本边界。
1. 论文基本信息
| 项目 | 内容 |
|---|---|
| 论文标题 | Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation |
| 论文编号 | arXiv:2609.11638 |
| 当前版本 | v1,2026-09-10 提交 |
| Daily Papers 状态 | 2026-09-15 提交至 Hugging Face,当日榜首 |
| 作者 | Jintao Zhang、Kai Jiang、Jintao Chen、Xu Wang、Deyuan Liu 等 35 位作者 |
| 机构 | 清华大学、Shengshu Technology |
| 研究方向 | 实时视频生成、数字人、流式视频编辑、空间视频 |
| 系统组成 | Vidu S2-Avatar、Vidu S2-Editing、VLM agentic system、空间视频转换管线 |
| 主要输出 | 720p 实时数字人;实时风格迁移、虚拟试衣、人物替换、背景替换;左右眼空间视频 |
| 报告帧率 | 25–42 FPS |
| 论文许可 | CC BY 4.0 |
| 开源状态 | 提供官方 GitHub 介绍仓库、在线产品、API 与技术报告;截至抓取时未发布模型权重或训练实现 |
核心链接:
- Hugging Face 详情页:https://huggingface.co/papers/2609.11638
- arXiv 摘要页:https://arxiv.org/abs/2609.11638
- arXiv 完整 HTML:https://arxiv.org/html/2609.11638v1
- arXiv PDF:https://arxiv.org/pdf/2609.11638
- 官方 GitHub:https://github.com/shengshu-ai/Vidu-S
- 官方项目页与在线演示:https://www.vidu.com/vidu-stream
- 官方 API 文档入口:https://platform.vidu.com/vidu-stream/doc
2. 背景与动机:从“生成文件”到“运行视觉状态”
2.1 离线扩散视频为什么不适合交互
Sora、Veo、Wan、Seedance 等模型主要优化完整视频质量:模型对整段时空 latent 反复去噪,完成后才交付结果。这适合广告、短片和素材生产,却无法支持对话、直播、游戏或 VR 中的连续反馈。交互系统面对的是另一组约束:
- 因果性:不能看到未来输入,只能用当前指令和历史状态生成下一块;
- 低延迟:画面必须持续输出,不能等待整段视频完成;
- 长程稳定:自回归误差会逐块积累,人物身份、背景和动作不能持续漂移;
- 运行时可控:指令和参考图会在流中途改变,系统需要保留未被要求改变的状态;
- 成本约束:视频 DiT、VAE 编解码和高分辨率恢复都必须挤进实时预算。
Vidu S1 已证明因果扩散可以用单张人物图和语音生成无限长度的 540p 流式视频,最高 42 FPS;但它仍偏向 talking head,启动后参考图固定,大幅肢体动作较弱,也不能编辑外部视频流。Vidu S2 的目标就是补齐这四个缺口。5
2.2 真正困难的是推理分布而非单帧清晰度
流式生成中,第 (i) 个块依赖模型自己生成的前 (i-1) 个块。若训练时总是看到干净真值历史,部署时却看到带误差的自生成历史,就会产生 exposure bias。短片中不明显的脸部偏差、背景移动或肢体变形,会在长流中递归放大。
Self-Forcing 已经让模型在训练时使用自身 rollout 和 KV cache,缩小训练—推理差距;Vidu S2 认为它仍有两个限制:自生成历史以干净状态输入,且与当前计算图断开,后段损失不能跨块回传。SRF 正是针对这两个问题设计。6
2.3 编辑比生成多了一条同步约束
数字人生成只需让输出响应音频与指令;实时编辑还必须与用户动作逐帧同步。若编辑模型让目标帧任意读取其他时间点的源帧,即使画质很好,也可能出现动作提前、滞后或身份信息跨帧污染。Vidu S2-Editing 因而把“源帧和目标帧的时间一一对应”直接写入 attention 结构,而不是仅靠训练数据学习。
3. 核心贡献
3.1 统一实时数字人与实时编辑
Vidu S2-Avatar 支持语音交互、大幅全身动作和运行时参考更新;Vidu S2-Editing 接收连续视频流,完成全局风格、服装、人物与背景四类编辑。两者共享从双向能力模型到分块因果模型的训练思路,也共享推理加速基础设施。
3.2 Self-Replay Forcing 缩小长流训练—推理差距
SRF 先让当前 student 完成长自回归 rollout,并将轨迹与 KV cache detach;再对整条自生成轨迹的各块独立加噪,在一个保留块间梯度连接的因果 pass 中重放。DMD 监督使 student 靠近 teacher 分布,perceptual loss 抑制 mode collapse。它避免保留原始长 rollout 的完整计算图,同时让后续块的损失在 replay 内跨块传播。
3.3 帧对齐注意力保证编辑时序
目标视频 token 可在目标序列内双向交互,但每个目标帧只访问同时间点源帧;参考图 token 则对所有帧开放。这个非对称设计把“动作与时序由源视频决定、外观由参考图决定”变成结构先验,也能自然转成因果流式版本。
3.4 动态参考与视觉反馈形成 agentic control loop
VLM agent 将用户文本或语音、初始人物图和新增参考图转成结构化 prompt,区分身份、表情、视线、姿势、动作与持续持有物。它按时间检查生成帧,判断动作已完成、部分完成或偏离,再决定保持结果状态还是修正后续指令。例如“拿起杯子,然后微笑”完成后,后续 prompt 会保留“继续拿着杯子”,只改变表情。
3.5 系统级推理优化而非只依赖蒸馏
论文同时压缩 attention、线性层、kernel launch、设备通信和模块空闲时间:不同层在 SageAttention、SpargeAttention 与 Sparse-Linear Attention 之间按敏感度选择;线性层使用 per-block W8A8 GEMM;稳定执行序列用 CUDA Graphs;多 GPU 采用 Ulysses-style context parallelism 并量化通信 tensor;VAE encoder、backbone、Refiner 和 VAE decoder 则沿共同时间线复用 GPU。
4. Vidu S2-Avatar 方法详解
4.1 数据管线:为动作、清晰度和时序重新筛选
Avatar 沿用 clipping、filtering、speech processing、captioning、embedding 五阶段框架,并做四项增强:
- 加入单人舞蹈、2D/3D 动画数据,扩大表情和全身动作分布;
- 对候选剪辑点用 VLM 二次检查,在保留细微转场检测能力的同时,将误拒率控制在 2% 以下;
- 不只按标称分辨率筛选,而综合分辨率、帧率、codec、pixel format、bit depth、bitrate、纹理、边缘与压缩伪影评价真实清晰度;
- 对轻微旋转、推拉或跟拍的视频先分割前景,再用背景特征匹配估计几何变换并稳定背景,避免为了静态背景丢弃丰富动作。
Caption 也从“主体、环境、镜头”字段列表改成按事件顺序排列的 dense caption,标注动作发生区间、组成步骤和结果。chunk 不再按固定时长或语音边界切分,而按事件边界切分,以降低指令切换时的响应延迟。
4.2 从双向模型到因果流式模型
基础模型是 reference-conditioned audio-visual joint DiT。参考图 在所有 segment 间共享,每段 都有自己的 caption 或条件 。训练同时覆盖:
- I2V:参考图是目标视频首帧;
- R2V:参考图是外部提供的人物、物体或场景图。
随后把时间 attention 换成 block-wise causal mask:当前块只能读取参考图、当前条件和有效历史。Teacher Forcing 提供干净真值历史,Diffusion Forcing 为历史注入不同噪声等级;二者混合,让模型既获得稳定起点,又适应不完美的生成历史。
4.3 Self-Replay Forcing 的两阶段过程
SRF 可拆成两个阶段:
- Rollout:student 按真实推理方式生成长轨迹,轨迹和 KV cache 均 detach,避免保存庞大的反向图;
- Replay:抽取自生成轨迹,对每块重新加噪,在一次 gradient-enabled causal pass 中重放,对所有块施加 DMD 与 perceptual loss。
关键区别在于:rollout 本身不回传,但 replay 中各块仍处于同一计算图。这样训练看到的是 on-policy 自生成状态,后段错误又能对前段表示施加学习信号。模型继续使用 sink blocks、sliding-window context 和 noisy KV cache 控制无限流的上下文成本。
4.4 偏好优化和单步超分辨率
双向阶段用 diffusion DPO 改善画质、表情、动作自然度和音画同步,为因果蒸馏提供更强 teacher;流式阶段使用 Streaming Negative-aware Fine-Tuning,在 SRF 自生成轨迹上做 reward-based optimization,进一步提高动作控制和指令遵循。
主干在较低分辨率 latent 上快速运行,单步 Refiner 负责放大到 720p。主干读取高噪声历史 cache,以传播粗粒度动作与长程结构;Refiner 读取低噪声高分辨率 cache,保留身份和局部纹理。这种非对称 cache 把“时间稳定”和“空间细节”分工处理,避免高分辨率主干直接吞噬实时预算。
4.5 VLM agent 的状态管理
运行时新增参考图会先被分类为手持物、背景或服装,再与用户意图合成 prompt。视觉反馈模块按时间检查动作完成度,并用置信度或重复观察的一致性决定是否接受。这个系统层补丁很重要:生成模型本身并不等于可靠状态机,VLM agent 负责把自然语言动作拆成可持续的视觉状态,并对失败做闭环纠正。
5. Vidu S2-Editing 方法详解
5.1 四类互斥数据各 20 万条
作者从 Avatar 管线筛选出的高质量视频中构建 80 万条数据,再划分为四个互不重叠的 20 万条子集:风格迁移、人物替换、背景替换和虚拟试衣。
风格迁移数据不是简单逐帧滤镜。系统先从原视频估计 surface-normal video,再训练条件模型用法线视频和参考帧重建原视频;生成配对数据时,把参考帧换成风格化图,保留原视频的空间结构与动作。作者称该方法覆盖超过 50 种写实和非写实风格。其他任务则结合专用编辑模型与 Bernini、SCAIL-2、Wan2.1 VACE、SAMA-14B、CoinVE-Edit 等开源模型生成候选,再做后过滤与比较选择。
Caption 只描述编辑目标、参考图属性和“非目标内容必须保留”的约束,不向 caption VLM 提供源视频,以防源内容从文本条件泄漏。
5.2 帧对齐的条件 DiT
模型接收 noisy target video、source video、reference image 和 segment-level instruction。源视频与参考图编码成条件 token,与目标 token 拼接,并用 condition-specific RoPE 区分各 token 流的时空位置。
双向阶段的注意力规则是:
- 目标帧之间可以双向建模,以建立强视觉和运动先验;
- 每个目标帧只与同时间点源帧交换信息,以保存动作和节奏;
- 所有目标帧都可读取参考图,以维持新外观的一致性。
因果阶段将目标时间 attention 改成 block-wise causal mask,并复用 Avatar 的 Hybrid Forcing 与 SRF。在线编辑时,每个源帧在产生对应目标帧后即可从 cache 中释放,避免源流无限占用显存。
5.3 跨模块时间调度
静态部署会为 VAE encoder、backbone、Refiner、VAE decoder 各自保留 GPU,即使某模块当前空闲也不能让出资源。Vidu S2 按视频块的执行时间线细粒度调度:backbone 或 Refiner 暂时不用某些 GPU 时,VAE 编解码器复用这些设备。这降低了专用 GPU 数量和端到端等待,但论文没有公开足够的模块级 latency 表,第三方仍无法量化每项优化的独立贡献。
6. 空间视频:有效原型,但不是原生 3D 世界模型
6.1 单目生成转左右眼视图
Vidu S2-Avatar 先生成普通单目视频块。后处理为每帧估计深度,将中心视图按水平视差向相反方向 warp,合成左右眼图像;对物体边界和 disocclusion 区域产生的孔洞做轻量补全,并在时间上稳定深度估计,减少深度闪烁。
6.2 两条编辑路径
- 单目输入:先由 Vidu S2-Editing 编辑,再转左右眼视图;
- 双目输入:先把左右视图横向拼接成宽视频,一次完成两眼编辑,再拆分输出。
这条路径能快速把实时 2D 系统接到头显,却没有显式 3D scene representation、多视角一致性约束或头部六自由度视点生成。用户转头后自由观察的 panoramic spatial video 被作者列为未来方向,而非当前能力。
7. 实验设计
7.1 任务与 benchmark
| 能力 | 数据集或协议 | 主要观察维度 |
|---|---|---|
| 流式数字人 | StreamAV-Bench | 视觉、音频、音画对齐、指令完成、主体与背景一致性 |
| 指令式视频编辑 | Sparkle-Bench | 全局/前景指令、画质、运动、背景动态与质量 |
| 风格与背景编辑 | OpenVE-Bench | Global Style、Background Change、Overall |
| 参考图编辑 | RefVIE-Bench | 参考忠实度、边界、视觉协调、时间一致性 |
| 无配对虚拟试衣 | ViViD test set | VFID,越低越好 |
| 商业数字人 | 内部随机 GSB 配对 | 质量、动作、表情、一致性、音画同步、语义遵循 |
| 商业视频编辑 | 150 对内部 GSB 样本 | Overall、画质、时间一致性、语义遵循 |
StreamAV-Bench 的 Progressive 与 Interactive track 各含 160 个场景;Interactive 每 30 秒更新一次、共 5 次,最长 180 秒。内部数字人协议还覆盖 160/320/480 ms 音频块、打断与恢复、5 分钟稳定性、端到端延迟和成本。内部编辑集另含 10 分钟级视频,用来观察遮挡、运动中的编辑区域和生成背景是否漂移。4
7.2 指标与评审
数字人评测同时使用 LAION Aesthetic Predictor、Gemini judge、AudioBox Aesthetics、ImageBind、Synchformer 以及长程主体/背景一致性指标。视频编辑沿用各 benchmark 的任务指标。内部 GSB 由 20 名具有计算机视觉、图形学、视频制作或画质评估背景的专业评审完成;评审先经过校准,再对同步输出选择 Good、Same 或 Bad,系统保留输入、随机种子、模型版本、服务区域和标注记录。
这比只给一项模型评分更完整,但仍要注意:公开表中的多个指标依赖 learned evaluator;内部 benchmark、商业系统版本和原始输出没有作为可复现数据集公开。
8. 核心实验结果
8.1 StreamAV-Bench:九项报告指标全部领先
| 模型 | VA ↑ | VQ ↑ | PQ ↑ | AQ ↑ | AVAlign ↑ | AVSync ↓ | AIF ↑ | SC ↑ | BC ↑ |
|---|---|---|---|---|---|---|---|---|---|
| Live Avatar | 0.661 | 3.295 | 7.133 | 3.079 | 0.116 | 1.145 | 2.745 | 0.997 | 0.989 |
| Self-Forcing | 0.585 | 2.753 | 6.453 | 2.623 | 0.256 | 0.919 | 2.810 | 0.981 | 0.969 |
| Vidu S2-Avatar | 0.687 | 3.370 | 7.138 | 3.286 | 0.353 | 0.617 | 2.985 | 0.998 | 0.993 |
表中只列最有代表性的对照;原表共比较 14 个系统。Vidu S2 的优势没有集中于单一画质分数:AVSync 最低,AVAlign、AIF、主体一致性和背景一致性也最高,说明其核心卖点确实落在流式音画协同和长程稳定,而不只是单帧清晰。
8.2 Sparkle-Bench:流式编辑超过所测离线与流式基线
| 模型 | Overall ↑ | Ins. ↑ | Vis. ↑ | FgIn. ↑ | FgMo. ↑ | BgDy. ↑ | BgVi. ↑ |
|---|---|---|---|---|---|---|---|
| Kiwi-Edit 5B | 3.57 | 3.84 | 3.33 | 3.76 | 3.81 | 3.00 | 3.68 |
| Decart-Lucy2.5 | 3.67 | 3.91 | 3.31 | 3.86 | 3.91 | 3.30 | 3.74 |
| Vidu S2-Editing | 3.74 | 4.00 | 3.34 | 3.98 | 4.00 | 3.37 | 3.76 |
领先幅度并不总是巨大,例如 Vis. 只比 Kiwi-Edit 高 0.01,BgVi. 比 Decart-Lucy2.5 高 0.02;更有意义的是它在维持实时流式约束的同时,没有以显著牺牲画质换速度。
8.3 OpenVE、RefVIE 与 ViViD
| 模型 | OpenVE GS ↑ | OpenVE BC ↑ | OpenVE Overall ↑ | RefVIE Overall ↑ | Joint Overall ↑ |
|---|---|---|---|---|---|
| Bernini-R 14B | 4.30 | 4.10 | 4.20 | 3.09 | 3.92 |
| Decart-Lucy2.5 | — | — | — | 3.71 | — |
| Vidu S2-Editing | 4.71 | 4.14 | 4.42 | 3.78 | 4.26 |
Vidu S2 的 Joint Overall 比最强可比较离线基线 Bernini-R 14B 高 0.34;RefVIE 比流式 Decart-Lucy2.5 高 0.07。无配对虚拟试衣中,Vidu S2 的 VFID 为 9.9515,CatV²TON 为 19.5131,ViViD 为 21.8032。按该指标定义,Vidu S2 的生成分布更接近参考视频分布。
8.4 人类偏好与长流案例
在作者内部比较中,Vidu S2-Avatar 的整体质量相对 Runway Character GWM-1 获得 85.7% 偏好,相对 PixVerse Image Avatar 与 HeyGen 均为 100%;语义遵循偏好率落在 71.4%–100%。但这些百分比呈现 14.3% 的步进,说明部分条件下有效配对数可能很小;论文没有在正文中给出每个柱子的完整计数和置信区间,不能把 100% 当作对商业系统的稳定总体优势。
视频编辑内部评测包含 150 对样本。平均一致性分数为 Vidu S2 3.56、Decart-Lucy2.5 2.59、XMax-X2.0 1.67。定性案例显示,Vidu S2 在水彩/工笔风格、白衬衫/牛仔服试穿、人物与卡通角色替换、巴黎咖啡馆/卧室背景替换中,更能保持姿态、相机轨迹、手—衣遮挡和细轮廓边界。
9. 结果应该如何解读
9.1 “全部第一”依赖统一评测条件
论文强调相同输入、预处理、时间采样、evaluator 和评分 rubric;只有在 benchmark、split 与 metric 完全一致时才复用已发表分数。这提高了表内可比性。但一些商业系统只能通过服务接口访问,版本、地区和安全策略可能改变输出,表格不是永恒不变的产品排行榜。
9.2 实时性是联合系统属性
25–42 FPS 不是单靠 SRF 获得,而是少步因果扩散、低分辨率主干、单步 Refiner、混合 attention、W8A8、kernel fusion、CUDA Graphs、context parallelism 和时间调度共同作用的结果。论文没有提供逐项消融,因此无法判断算法创新和工程优化分别贡献多少,也无法据此预测换硬件或移植开源模型后的速度。
9.3 空间视频证据只能支持“可行性展示”
空间视频没有公开 benchmark 数值,只展示左右眼图和主观深度分离。单目深度加 warp 的方案容易在头发、手指、透明物体、快速运动和遮挡边界处产生错误;时间稳定深度与轻量补洞能缓解但不能消除。没有头显上的 motion-to-photon latency、眩晕率、双目冲突或用户舒适度实验,就不能把它等同于生产可用的实时 VR 世界模型。
10. 局限与批判性分析
10.1 关键训练细节披露不足
论文未充分公开 Avatar 与 Editing 的参数量、训练时长、GPU 数量、数据许可组成、DPO/NFT 奖励模型细节和完整超参数,也未发布权重与训练代码。SRF 的思想可以理解,但外部团队难以复现报告中的质量和吞吐。
10.2 速度、延迟和成本缺少完整账本
作者报告 720p、25–42 FPS,并称可在低成本 GPU 上服务,但没有在主文中给出具体 GPU SKU、batch size、并发数、首帧延迟、语音识别延迟、VLM agent 延迟、网络传输、P50/P95 延迟和每分钟成本。帧率满足实时不等于交互响应足够快;多 GPU context parallelism 也可能提高部署门槛。
10.3 缺少针对核心组件的消融
公开结果比较了完整系统与外部基线,却没有系统拆分 SRF、Streaming NFT、动态参考训练、视觉反馈、Refiner cache 设计、不同 attention 与 W8A8 的独立增益。因而“为什么赢”仍主要由方法叙述解释,而不是由受控消融识别。
10.4 数据合规与身份安全未展开
数字人、人物替换和虚拟试衣直接涉及肖像权、深度伪造、冒充、未成年人安全和训练数据授权。论文只提到内容安全过滤,没有报告水印、生成内容标识、活体与授权验证、滥用红队、偏见或跨肤色/体型/服饰评测。这些不是外围产品问题,而是实时人物生成能否部署的核心条件。
10.5 人类评测与 learned judge 都有统计边界
20 名专业评审与校准流程值得肯定,但部分数字人 GSB 的样本规模看起来很小,正文没有给置信区间。StreamAV-Bench 多项分数依赖 Gemini 等 learned judge,也没有报告 judge variance 或多 judge 一致性。公开 benchmark 第一不等于真实用户在所有输入分布上都会偏好。
10.6 空间视频不是几何一致的可探索场景
当前方法从每帧深度合成立体对,适合固定观看方向;它没有持续 3D geometry、自由视点重渲染或 panoramic scene memory。论文自己也把可转头探索的全景空间视频列为未来工作。称其为“空间视频生成”合理,但称其为“实时 3D 世界生成”会超出证据。
11. 应用影响
11.1 实时数字人与直播
动态参考图让数字人在不中断会话的情况下换装、换景或拿起指定商品,适合直播导购、虚拟客服、远程教育和互动娱乐。VLM feedback loop 还提供了把高层自然语言意图转成持续视觉状态的通用架构。
11.2 摄像头流与创作工具
Vidu S2-Editing 可以把“录制后剪辑”前移为“输入时编辑”:直播风格化、实时背景、虚拟试衣、角色扮演、预可视化和视频会议都是直接场景。帧对齐 attention 对任何需要保留原动作的 streaming transformation 都有借鉴价值。
11.3 XR 与 passthrough
单目流先编辑再转双目,可为现有 2D 内容提供低成本 XR 入口;双目流联合编辑则可作用于头显 passthrough。但实际产品必须优先验证头动延迟、双目一致性和失配时的安全降级,不能只看离线左右眼截图。
11.4 推理基础设施
最可迁移的经验可能不是具体产品能力,而是“模型与 runtime 共设计”:低分辨率因果主干负责时间结构,轻量 Refiner 恢复空间细节;按层选择近似 attention;量化通信而不仅量化权重;按时间复用异构模块的 GPU。其他实时多阶段生成系统也可以采用类似预算分配。
12. 相关工作与技术定位
12.1 Vidu S1:实时交互的直接前身
Vidu S1 以 TurboDiffusion 和 TurboServe 支持 540p、最高 42 FPS 的无限流数字人,确立了 voice-controlled causal video generation 路线。S2 保留其 sink block、sliding window、noisy KV cache 和系统加速思想,同时把分辨率提升到 720p,引入全身动作、动态参考和外部视频编辑。5
12.2 Self-Forcing:从真值历史转向自生成历史
Self-Forcing 针对 autoregressive video diffusion 的 exposure bias,在训练中用模型自身 rollout 和 KV cache 作为条件,并以截断梯度控制成本。SRF 沿这一路线继续前进:它对自生成轨迹重加噪,并在 replay 内恢复跨块梯度连接。二者不是互斥方法,而是从“看到推理分布”到“在推理分布上更充分学习”的递进。6
12.3 TurboDiffusion 与实时推理栈
TurboDiffusion 把低比特 SageAttention、Sparse-Linear Attention、step distillation、W8A8 和工程优化组合用于视频扩散加速。Vidu S2 将这些思路扩展到持续流服务,再加入层级敏感度选择、CUDA Graphs、多 GPU 量化通信与跨模块调度。7
12.4 流式视频编辑
Bernini、Kiwi-Edit、VInO、OmniWeaving、LiveEdit、VACE、StreamDiffusionV2、XMax-X2.0 和 Decart-Lucy2.5 等路线覆盖离线或流式编辑。Vidu S2 的定位不是增加第五类编辑任务,而是用一个 reference-conditioned causal DiT 统一四类常见编辑,并把源—目标同步写进 attention mask。
12.5 流式评测
传统 VBench 类评测偏向完成视频,难以测量运行时指令更新、状态保持和长流漂移。StreamAV-Bench 专门设置 Progressive 与 Interactive tracks,并覆盖 32 个细粒度维度;Vidu S2 使用它来证明优势来自交互与稳定性,而非只在短片画质上领先。8
13. 实践建议与后续研究
对准备复用这条路线的研究或工程团队,优先级应是:
- 把首帧延迟、指令到动作延迟、steady-state FPS、P95 抖动、显存与每分钟成本分开测量;
- 用相同 backbone 做 Teacher Forcing、Diffusion Forcing、Self-Forcing 与 SRF 受控消融;
- 公开不同长度下的身份、背景与动作误差曲线,而不只给 90 秒或 5 分钟终点;
- 对动态参考建立状态机 benchmark,测量新增、撤销、冲突参考和失败恢复;
- 对编辑任务加入快速遮挡、多人交互、镜面、透明材质、极端光照与跨镜头测试;
- 对空间视频测量深度误差、左右眼冲突、disocclusion artifact、motion-to-photon latency 和用户舒适度;
- 把人物授权、水印、内容凭证、滥用检测和审计日志纳入系统指标;
- 发布最小可复现权重、推理配置和硬件基准,使速度—质量结论可以外部验证。
14. 结论
Vidu S2 的真正进步,是把高质量视频模型从一次性交付工具推进为持续接收指令、参考图和源视频的运行系统。SRF 处理自生成历史上的训练问题,帧对齐 attention 保存编辑时序,VLM agent 管理动态视觉状态,Refiner 与推理栈则把这些能力压进实时预算。公开 benchmark 表明 Avatar 与 Editing 都具备很强竞争力。
同时,这篇技术报告更像完整商业系统的研究说明,而不是可独立复现的开放模型论文。模型规模、训练细节、硬件和延迟账本、关键消融、安全评测仍明显不足;空间视频也处于可行性原型阶段。对行业而言,它证明了实时生成与实时编辑正在汇合;对研究而言,下一步最重要的不是再增加演示能力,而是把可复现性、长程因果误差、交互延迟和安全边界纳入同一套公开评测。
参考资料
官方 GitHub 介绍仓库:https://github.com/shengshu-ai/Vidu-S
Footnotes
-
Hugging Face Daily Papers, Sep 15 列表与榜首论文:https://huggingface.co/papers ↩
-
Hugging Face 论文详情页,Vidu S2 摘要、作者与项目入口:https://huggingface.co/papers/2609.11638 ↩
-
Zhang et al., “Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation,” arXiv v1 完整正文:https://arxiv.org/html/2609.11638v1 ↩ ↩2
-
Zhang et al., Vidu S2 实验与公开 benchmark 结果,arXiv:2609.11638:https://arxiv.org/abs/2609.11638 ↩ ↩2
-
Zhang et al., “Vidu S1: A Real-Time Interactive Video Generation Model,” arXiv:2607.03118:https://arxiv.org/abs/2607.03118 ↩ ↩2
-
Huang et al., “Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion,” arXiv:2506.08009:https://arxiv.org/abs/2506.08009 ↩ ↩2
-
Zhang et al., “TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times,” arXiv:2512.16093:https://arxiv.org/abs/2512.16093 ↩
-
Liu et al., “StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation,” arXiv:2608.26336:https://arxiv.org/abs/2608.26336 ↩