Logo
热心市民王先生

[硅基写手] Hugging Face Papers 每日论文解读:Vidu S1

论文解读 Vidu S1 Video Generation Real-time AI Hugging Face arXiv

基于 2026-07-11 早间 Hugging Face Papers 顶部论文 Vidu S1,解读实时交互式视频生成、语音控制、三阶段训练、TwinCache、系统加速、实验结果、局限与应用影响。

自动研究时间:2026-07-11 09:00(Asia/Shanghai)
抓取路径:Hugging Face Papers 最新列表 -> 顶部论文详情页 -> arXiv Page -> arXiv PDF / TeX Source -> Project Page / GitHub 交叉核对
抓取状态:本次访问 https://huggingface.co/papers 时,页面最新可见 Daily Papers 为 Jul 10;顶部论文为 #1 Paper of the day,Hugging Face 详情页标注论文 Published on Jul 3、Submitted on Jul 10。arXiv HTML 页面未提供可解析全文,因此本报告基于 arXiv PDF 与 TeX Source 分析。

执行摘要

本次自动调研从 Hugging Face Papers 当前最新可见列表获取到的顶部论文是 Vidu S1: A Real-Time Interactive Video Generation Model。Hugging Face 详情页为 https://huggingface.co/papers/2607.03118,对应 arXiv 页面为 https://arxiv.org/abs/2607.03118,PDF 为 https://arxiv.org/pdf/2607.03118,项目页 / 在线体验入口为 https://vidu.com/vidu-stream,GitHub 仓库为 https://github.com/shengshu-ai/Vidu-S1

一句话概括:Vidu S1 把视频生成从“离线输入 prompt 后等待成片”推进到“用户可在视频流生成过程中用语音持续控制数字角色”,并把模型训练、滑窗推理、缓存策略、量化算子和多 GPU 服务栈一起纳入实时系统设计。

论文的核心判断是:下一阶段视频生成的关键不只是画质,而是交互性。Sora、Veo、Wan、Seedance 等模型已经证明了高质量离线视频生成的价值,但用户在直播、视频通话、游戏、虚拟主播和陪伴式角色中需要的是低延迟响应。Vidu S1 因此把任务定义为 speech-guided future video generation:用户说出动作或意图,系统要在不中断视频流的情况下让角色接着做出对应动作。

关键结论包括:

  • Vidu S1 面向语音控制的数字角色视频生成,支持真实人物、动漫角色、宠物等自定义角色形象和声音。
  • 模型目标是无限长度实时生成,而不是一次性生成固定时长片段;论文称其在长时间流式生成中避免明显模糊、漂移和视觉崩坏。
  • 训练数据来自高质量单人、单镜头视频,包括直播 / talking-head 视频,以及影视剧素材;数据管线包含去重、预筛选、单镜头切分、主体过滤、质量与安全过滤、说话人 diarization 和多粒度 caption。
  • 训练分三阶段:先训练双向 video-audio teacher,再用 Teacher Forcing + Diffusion Forcing 训练因果 teacher,最后用 DMD + PCM 正则把生成过程蒸馏成少步采样。
  • 推理采用滑动窗口自回归解码、persistent reference context、RoPE Repositioning 和 TwinCache,以固定上下文长度支持任意长视频流。
  • 系统侧使用 TurboDiffusion / TurboServe 技术路线,包括 attention acceleration、W8A8 per-block quantized GEMM、kernel fusion、CUDA Graph 和 Ulysses-style context parallelism。
  • 在 HDTF 指标上,Vidu S1 达到 CSIM 0.9192Sync-D 7.8470DOVER 0.5660,均为表中最佳;同时支持 instruction following 和 real-time。
  • 论文报告在 RTX 5090 GPU 上,Vidu S1 使用 3-step 配置生成 540p (960x540) 视频,平均吞吐达到 42 FPS,超过 30 FPS 实时播放阈值。
  • 在 Vidu-StreamBench 的人类偏好评测中,Vidu S1 相对 HeyGen、LemonSlice、Kling Avatar 2.0 被整体偏好;在 subject controllability 上,相对 HeyGen 和 LemonSlice 达到 100% preference

我的判断:这篇论文的价值不在于提出一个全新基础架构,而在于把“实时互动视频生成”完整地工程化了。它把模型、数据、蒸馏、缓存、算子、量化和服务并列为必要条件,这比单纯报告一个视频模型 benchmark 更接近真实产品问题。但它的局限也很明显:论文没有公开训练数据规模、模型参数量、端到端延迟分布、消融实验和开放 benchmark 详情;Vidu-StreamBench 是内部基准,人类偏好评测也缺少样本设计和统计细节。因此,Vidu S1 更适合作为“实时数字角色视频生成系统”的方向性样本,而不是一个已经可完全复现的开放研究基线。

1. 论文基本信息

项目内容
论文标题Vidu S1: A Real-Time Interactive Video Generation Model
作者Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zheng, Haoxu Wang, Xiaohang Wang, Qi Jia, Xin Chen, Yimin Chen, Youhe Jiang, Fangcheng Fu, Zhijie Deng, Fan Bao, Jianfei Chen, Jun Zhu
机构Tsinghua University, Shengshu Technology
arXiv 编号2607.03118
arXiv 版本v1
arXiv 提交日期2026-07-03 08:58:06 UTC
学科分类Computer Vision and Pattern Recognition; Machine Learning
Hugging Face 状态Jul 10 Daily Papers 顶部论文,#1 Paper of the day
论文类型System / implementation paper,13 pages
核心关键词Real-time Video Generation, Interactive Video, Digital Avatar, Speech Control, Autoregressive Diffusion, DMD, PCM, TwinCache, TurboDiffusion, TurboServe
主要链接HF: https://huggingface.co/papers/2607.03118;arXiv: https://arxiv.org/abs/2607.03118

2. 研究背景和动机

2.1 离线视频生成的强项与边界

过去两年,视频生成模型的主线是“更长、更清晰、更符合 prompt”。Sora、Veo、Wan、Seedance 等系统把 text-to-video / image-to-video 的视觉质量推到很高水平。但它们大多仍遵循离线范式:

  1. 用户输入 prompt;
  2. 模型同步 denoise 一整段视频;
  3. 用户等待数十秒到数分钟;
  4. 系统返回完整视频;
  5. 如果用户想修改,只能重新生成或局部编辑。

这个范式适合广告片、短视频、概念预览等一次性交付内容,却不适合直播、视频通话、虚拟陪伴、游戏 NPC、实时教学这些场景。后者的关键是 turn-by-turn interaction:用户说一句,角色马上反应;用户中途改变意图,视频流不能停下来重算。

论文用一个需求模型说明为什么实时交互可能比离线生成更重要。设每个用户对实时交互视觉内容的平均需求为 (\alpha),用户数为 (N),则实时需求近似为:

Dinteractive=α×ND_{\mathrm{interactive}} = \alpha \times N

离线视频可被回放和分享,如果每个生成视频平均被观看 (m) 次,设离线生成需求为 (\beta),则离线生成需求更接近:

Doffline=β×NmD_{\mathrm{offline}} = \frac{\beta \times N}{m}

当 (\alpha \approx \beta)、且 (m > 100) 时,实时交互生成请求量会显著高于离线生成请求量。这个推导不应被理解为严格市场测算,而是表达一个系统设计信号:实时生成不是离线生成的“小改款”,它会把延迟、吞吐、服务成本和连续稳定性推到核心位置。

2.2 现有方法的缺口

论文把现有视频生成路线的缺口归纳为四类:

缺口具体问题对实时互动的影响
只改成 autoregressive,不支持用户中途交互一些方法能逐段生成视频,但用户不能在生成过程中自然干预更像长视频生成,不是真正互动
缺少语音作为显式控制信号多数方法仍主要依赖文本 prompt、历史帧或动作条件用户无法像视频通话一样自然控制角色
长时程误差累积小错误随自回归 rollout 放大,导致身份漂移、背景漂移、画面崩坏无限长度视频流很难稳定
缺少系统栈支撑模型即使能生成,也可能太慢、太贵、服务调度不稳定无法进入低延迟产品场景

Vidu S1 的目标因此不是“生成一段更好看的 avatar 视频”,而是做一个完整的实时互动生成系统:用户上传角色图像和声音,开启视频通话式交互,用语音持续控制角色动作。

3. 核心贡献和创新点

3.1 任务定义:从 audio-driven avatar 到 speech-guided future control

传统 talking-head / audio-driven avatar 模型通常关注嘴型同步、面部表情和身份一致性。输入是一段音频,输出是一个人像在说话。这类任务的问题是:音频主要决定“说什么、嘴怎么动”,不一定能表达“接下来请挥手、比心、抬头、坐下、竖大拇指”。

Vidu S1 把问题推进到 speech-guided future video generation:

  • speech 不只是嘴型同步的输入,而是未来动作控制信号;
  • reference image 不只是身份约束,而是持续视频流中的角色锚点;
  • text / speech prompt 不只在开头生效,而是可以在线更新;
  • 目标不是固定长度片段,而是任意长的低延迟视频流。

论文 Figure 1 的 overview 可以拆成三层:

Figure 1 模块含义为什么重要
Speech-Guided Future Video Generation用户说“挥手”“比心”“竖大拇指”等,角色在后续视频中执行把视频生成变成实时控制问题
Infinite Efficient Inference and Serving540p、最高 42 FPS、低成本 GPU、TurboDiffusion / TurboServe说明瓶颈不仅是模型,还有推理和服务
Various Custom Characters支持真实人物、动漫、宠物等角色指向个性化 avatar / IP / 陪伴场景

3.2 数据管线:用高质量单人单镜头视频训练可控角色行为

论文的 Figure 2 是数据过滤流程。它不是简单爬取视频,而是把原始视频逐步变成“可学的流式交互片段”:

flowchart TD
    A["原始视频: 直播 / talking-head / 影视剧素材"] --> B["去重与预筛选: 帧率 / 分辨率 / 音画完整性 / 音画同步"]
    B --> C["单镜头切分: 避免跨镜头跳变"]
    C --> D["主体过滤: 保留单人主体且占比合理"]
    D --> E["质量与安全过滤: 清晰度 / 水印字幕 / NSFW / 抖动 / 闪烁"]
    E --> F["说话人 Diarization: onscreen / offscreen / overlap"]
    F --> G["过滤重叠语音和低质量 vocalization 片段"]
    G --> H["Clip-level Caption + Speech-aware Chunk-level Caption"]
    H --> I["训练数据: 高质量、时序一致、语义可控的视频音频片段"]

这条管线的关键不只是“清洗数据”,而是显式服务于实时互动:

  • 单镜头片段减少镜头切换造成的身份和背景突变;
  • 单主体过滤让模型聚焦一个数字角色,而不是多人场景;
  • shot stability 降低长时程漂移风险;
  • interactivity filtering 保留主体有明确动作的片段,让模型学会可见行为;
  • speech diarization 确认画面中的人和声音匹配,避免嘴型同步学错;
  • speech-aware chunk captions 把文本描述对齐到时间片段,提供更细粒度的可控条件。

值得注意的是,论文引入 Qwen3-Omni / Gemini 类 omni model 辅助全局语义理解。原因很现实:人脸检测、NSFW 检测、美学打分等 expert model 很强,但它们通常按帧或局部区域判断,遇到动漫风格、夸张表情、复杂镜头语言时容易误判。Omni model 则负责给完整视频打上编辑、主体、动作、情绪、脸部、语音、场景、镜头、tone 等多维标签。

3.3 三阶段训练:先学质量,再学因果,再做少步蒸馏

Vidu S1 的训练框架把视频和音频表示拼成 joint state。设第 (i) 帧的 clean video representation 为 ({\bm{v}}_0^i),clean audio representation 为 ({\bm{a}}_0^i),则联合状态为:

x0i=[v0i;a0i]{\bm{x}}_0^i = [{\bm{v}}_0^i; {\bm{a}}_0^i]

其中 ([\cdot;\cdot]) 表示沿模态维拼接。对长度为 (N) 的序列,联合状态为:

x01:N={x01,,x0N}{\bm{x}}_0^{1:N}=\{{\bm{x}}_0^1,\ldots,{\bm{x}}_0^N\}

统一条件 ({\bm{c}}) 包含 speech、text prompts 和 reference images。训练分三步:

阶段目标关键机制
Stage 1: Bidirectional Teacher Training学高质量 video-audio 生成先验双向 teacher 看到完整条件序列,训练全序列 denoising
Stage 2: Causal Teacher Training适配流式自回归生成加 causal attention mask;结合 Teacher Forcing 和 Diffusion Forcing
Stage 3: DMD + PCM Regularization把多步扩散压缩到少步采样用 Distribution Matching Distillation 提速,用 PCM 抑制 mode collapse

Stage 1 的双向 teacher 写作:

x^01:N=fθbi(xtj1:N,tj,c1:N)\hat{{\bm{x}}}_{0}^{1:N} = f_\theta^{\mathrm{bi}}({\bm{x}}_{t_j}^{1:N},t_j,{\bm{c}}^{1:N})

训练目标是标准 denoising MSE:

Lbi=E(x01:N,c1:N),tj[fθbi(xtj1:N,tj,c1:N)x01:N22]\mathcal{L}_{\mathrm{bi}} = \mathbb{E}_{({\bm{x}}_0^{1:N},{\bm{c}}^{1:N}),\,t_j} \left[ \left\| f_\theta^{\mathrm{bi}}({\bm{x}}_{t_j}^{1:N},t_j,{\bm{c}}^{1:N}) - {\bm{x}}_{0}^{1:N} \right\|_2^2 \right]

Stage 2 转成因果 teacher。对每个 (i>1),模型只预测当前 joint state,并只能看当前及过去条件 ({\bm{c}}^{\leq i}) 和历史前缀:

x^0i=fθ(xtji,tj,ci,xτj<i,τj)\hat{{\bm{x}}}_{0}^{i} = f_\theta({\bm{x}}_{t_j}^{i},t_j,{\bm{c}}^{\leq i},{\bm{x}}_{\tau_j}^{<i},\tau_j)

这里的关键是 (\tau_j)。如果 (\tau_j=0),历史前缀是干净真值,这就是 Teacher Forcing,训练稳定但和推理时“历史由模型自己生成”有差距。如果 (\tau_j>0),历史前缀带噪声,这就是 Diffusion Forcing,可提升模型对不完美历史的鲁棒性。论文每个样本从 (\mathrm{Bernoulli}(p)) 采样,决定使用哪种方式。

Stage 3 用 DMD 压缩采样步数。DMD 的目标不是逐像素模仿 teacher,而是让生成分布向真实数据分布靠近。论文给出的梯度形式为:

θLDMD=Ez,t[w(t)(xt1:Nlogpdatat(xt1:N)xt1:Nlogpθt(xt1:N))dxt1:Ndθ]\nabla_{\theta}\mathcal{L}_{\mathrm{DMD}} = \mathbb{E}_{z,\,t} \left[ w(t) \left( \nabla_{{\bm{x}}^{1:N}_{t}} \log p_{\mathrm{data}}^{t}({\bm{x}}^{1:N}_{t}) - \nabla_{{\bm{x}}^{1:N}_{t}} \log p_{\theta}^{t}({\bm{x}}^{1:N}_{t}) \right)^{\top} \frac{d {\bm{x}}^{1:N}_{t}} {d\theta} \right]

直观理解:DMD 用“真实分布的 score”和“生成分布的 score”之间的差异来更新少步生成器。但论文也指出,仅用 DMD 容易 mode collapse,表现为镜头漂移、内容退化和时间不一致。因此他们加入 PCM consistency regularization:

LPCM=E[λ(tn)dPERC(fθ(xtn+11:N,tn+1),fθ(x~tn1:N,tn))]\mathcal{L}_{\mathrm{PCM}} = \mathbb{E} \left[ \lambda(t_n)\, d_{\mathrm{PERC}} \left( f_{\theta}({\bm{x}}^{1:N}_{t_{n+1}},t_{n+1}), f_{\theta^-}(\tilde{{\bm{x}}}_{t_n}^{1:N},t_n) \right) \right]

其中 (d_{\mathrm{PERC}}) 是 perceptual feature distance,(f_{\theta^-}) 是 EMA student network。实际含义是:少步生成器不仅要快,还要在不同噪声阶段保持感知一致,避免为了追求速度牺牲时序稳定性。

3.4 推理:滑窗、RoPE Repositioning 与 TwinCache

Vidu S1 的推理核心是在线自回归生成。第 (i) 个解码步骤中,attention 只看固定长度滑动窗口,窗口包含三部分:

  1. Persistent reference context:用户提供的第一帧 reference image latent,加上第一个生成的 video-audio state;
  2. Cached historical states:窗口内保留的历史 video-audio 状态;
  3. Current state:当前正在 denoise 的 video-audio 状态。

这个设计的目的很明确:无论视频已经生成 10 秒还是 90 分钟,单步上下文长度都基本固定,所以延迟不会随总时长线性增长。persistent reference context 类似 LLM streaming 里的 sink token,也类似一些 infinite video 方法里的 sink frame:它让角色身份和全局风格始终有锚点。

TwinCache 是更有意思的部分。每个历史状态保留两种 cache:

Cache何时使用作用
Noisy cache (\hat{\bm{x}}_{\tau_j}^{<i})中间 denoising 步骤保留粗粒度时间动态,降低高频伪影累积
Clean cache (\hat{\bm{x}}_{0}^{<i})最终 denoising 步骤恢复细节、身份一致性和视觉清晰度

换句话说,Vidu S1 不把历史帧都当作完全干净的约束。中间阶段使用 noisy history,相当于给模型一个“低通”的历史动态先验,减少模型被旧帧细节牵着走;最后阶段再看 clean history,补回视觉细节。这是面向长视频稳定性的缓存策略。

flowchart LR
    A["用户参考图像 + 语音 / 文本条件"] --> B["Persistent Reference Context"]
    B --> C["滑动窗口自回归解码"]
    D["历史状态 Noisy Cache"] --> C
    E["历史状态 Clean Cache"] --> C
    C --> F["中间 denoising: 使用 Noisy Cache 维持动态稳定"]
    F --> G["最终 denoising: 使用 Clean Cache 恢复细节"]
    G --> H["当前 video-audio state"]
    H --> I["追加到视频流并更新 TwinCache"]
    I --> C

3.5 系统加速:模型能力必须和 serving 栈一起设计

论文把实时性归因于 TurboDiffusion 和 TurboServe 技术路线。具体包括:

技术解决的问题论文中的作用
SageAttention / SpargeAttention / Sparse-Linear Attentionattention latency 高、算力占比大降低 diffusion transformer attention 成本
Per-block W8A8 quantized GEMMper-tensor / per-channel 量化容易受 outlier 影响通过 CUDA 自定义 block-wise 量化算子加速线性层并保持质量
Kernel fusion小 kernel 多、launch 和同步开销高融合 RMSNorm 与部分 elementwise 操作,减少带宽和调度开销
CUDA Graph流式生成计算图重复、短算子多捕获固定子图并 replay,减少 host launch overhead
Ulysses-style context parallelism单卡序列长度和显存受限多 GPU 分摊 sequence 维计算和 activation memory

这也是论文最工程化的部分:实时视频生成不是“模型少采样几步”就够了。42 FPS 的结果来自模型蒸馏、缓存策略、量化、attention kernel、CUDA Graph 和多卡并行的共同作用。

4. 实验设计和主要结果

4.1 Benchmark 设置

论文使用两个评测集:

Benchmark类型用途
Vidu-StreamBench内部 benchmark,500 samples测试实时互动 avatar 生成,样本由 action instruction、reference first frame、audio clip 构成
HDTF公开 audio-driven avatar benchmark测身份保持、音画同步、感知质量

Vidu-StreamBench 覆盖动作命令、参考图像风格、说话者属性、情绪和应用场景。论文用 pairwise A/B 人类偏好测试比较 Vidu S1 与 HeyGen、LemonSlice、Kling Avatar 2.0。HDTF 上则比较商业系统和开源模型,包括 Wan2.2-S2V-14B、LiveAvatar、OmniAvatar-1.3B、Hallo3、StableAvatar-1.3B。

评价指标包括:

指标方向含义
CSIM越高越好基于 ArcFace 类特征衡量身份保持
Sync-D越低越好基于音画同步模型衡量唇形 / 语音对齐距离
DOVER越高越好视频感知质量评价
FPS / Throughput越高越好实时生成吞吐
Human Preference越高越好人类对动作控制、运动自然性、稳定性和整体质量的偏好

4.2 HDTF 定量结果

ModelInstruction FollowingReal-TimeResolutionFPS / ThroughputCSIM ↑Sync-D ↓DOVER ↑
OmniAvatar480p0.80629.2420.5476
StableAvatar-1.3B480p0.835811.180.5560
Hallo3480x7200.76988.6600.5313
Wan2.2-S2V-14B480p / 720p0.79368.2550.5510
LiveAvatar0.81278.4470.5639
LemonSlice368x5600.84077.9210.5196
HeyGen25 FPS0.91918.0370.4864
Kling Avatar 2.00.86888.1580.5406
Vidu S1540p (960x540)42 FPS0.91927.84700.5660

这个表的关键信息不是某个单项指标领先 0.0001,而是 Vidu S1 同时满足四个条件:

  • 有 instruction following;
  • 是 real-time;
  • 分辨率达到 540p;
  • 在身份保持、音画同步、感知质量上都不弱于对照系统。

如果只看 CSIM,HeyGen 的 0.9191 和 Vidu S1 的 0.9192 几乎没有实质差异;真正差异在于 HeyGen 不支持 instruction following,而 Vidu S1 把动作控制和实时生成放在同一系统里。

4.3 Vidu-StreamBench 人类偏好

论文 Figure 3 显示,Vidu S1 与 HeyGen、LemonSlice、Kling Avatar 2.0 做 pairwise A/B preference 时整体被偏好。最突出的结果是 subject controllability:

  • 相比 HeyGen,Vidu S1 在 subject controllability 上达到 100% preference;
  • 相比 LemonSlice,Vidu S1 在 subject controllability 上达到 100% preference;
  • 相比 Kling Avatar 2.0,论文展示的 qualitative comparison 中,Vidu S1 更能完成“抬头思考”“竖大拇指”等动作指令。

这个结果符合任务定义:HeyGen / LemonSlice 等商业 avatar 系统强在说话人呈现,但并不一定把自然语言动作命令作为核心控制信号;Kling Avatar 2.0 支持 instruction following,但论文认为其稳定性和动作执行仍弱于 Vidu S1。

4.4 实时性能

论文报告 Vidu S1 在 RTX 5090 GPUs 上使用 3-step 配置,生成 540p 视频,平均吞吐为 42 FPS。这个数字有两个含义:

  1. 超过 30 FPS 播放阈值:从“生成后播放”进入“边生成边交互”的可行区间;
  2. 生成质量未被完全牺牲:HDTF 表格显示身份、同步和质量指标仍领先或接近领先。

但这里仍需要谨慎。论文报告的是 FPS / throughput,而不是完整产品体验中的端到端延迟。真正的视频通话场景还包括语音识别、语义理解、prompt 调度、网络传输、编码解码、客户端渲染等延迟。42 FPS 说明模型生成链路有实时潜力,不等于用户感知延迟已经被完整证明。

5. 关键图表和公式解读

5.1 Figure 1:产品目标图,而不是单纯模型结构图

Figure 1 展示了三个承诺:语音控制未来视频、高效无限推理、自定义角色。它更像产品目标图,而不是标准 neural architecture 图。读这张图要抓住一个转变:Vidu S1 不把 video generation 当成“输入 prompt -> 输出 mp4”,而是当成一个持续状态系统。

5.2 Figure 2:数据质量决定可控性上限

Figure 2 的数据管线说明,实时互动 avatar 的难点并不只是模型。若训练数据中主体经常换人、镜头频繁切换、音画不同步、字幕水印过多、说话人不在画面里,那么模型学到的就是错误关联。Vidu S1 的数据清洗重点放在单主体、单镜头、音画一致和动作可见上,这些约束直接服务于“角色稳定”和“动作可控”。

5.3 公式组:从双向生成到因果流式生成

双向 teacher 公式:

x^01:N=fθbi(xtj1:N,tj,c1:N)\hat{{\bm{x}}}_{0}^{1:N} = f_\theta^{\mathrm{bi}}({\bm{x}}_{t_j}^{1:N},t_j,{\bm{c}}^{1:N})

含义:先让模型在完整上下文中学会高质量 video-audio denoising。

因果 teacher 公式:

x^0i=fθ(xtji,tj,ci,xτj<i,τj)\hat{{\bm{x}}}_{0}^{i} = f_\theta({\bm{x}}_{t_j}^{i},t_j,{\bm{c}}^{\leq i},{\bm{x}}_{\tau_j}^{<i},\tau_j)

含义:真实推理时模型不能看未来,只能看当前条件和历史前缀。这个公式是论文从“离线视频生成”转向“流式视频生成”的核心。

DMD + PCM 公式组的含义是:少步生成很快,但容易退化;因此需要分布匹配提升效率,也需要一致性正则保持稳定。

5.4 Table 1:最重要的是能力组合

Table 1 的读法不是“Vidu S1 在 CSIM 上比 HeyGen 高 0.0001”,而是能力组合:

能力组合代表模型问题
高身份一致 + 实时HeyGen不支持动作 instruction following
指令跟随Kling Avatar 2.0表中非 real-time,定量指标不占优
开源 audio-driven avatarOmniAvatar / Hallo3 / StableAvatar缺少实时和动作控制
实时 + 指令跟随 + 高指标Vidu S1论文声称的核心位置

6. 局限性和未来工作

论文正文没有专门的 limitations section,因此以下是基于方法和实验设计的批判性分析。

6.1 可复现性不足

论文没有公开以下关键信息:

  • 模型参数规模;
  • 训练数据总时长、样本数量和数据许可细节;
  • 训练算力、batch size、训练时长;
  • DMD / PCM 权重、采样步数更多细节;
  • Vidu-StreamBench 的完整样本、标注协议和评价界面;
  • 人类偏好评测人数、随机化方式、显著性检验。

这意味着外部研究者很难复现 Vidu S1,也很难判断 42 FPS 和偏好结果是否可迁移到其他硬件、角色风格和语言环境。

6.2 内部 benchmark 的外部有效性有限

Vidu-StreamBench 是 in-house benchmark。它对产品研发有价值,但学术说服力弱于公开 benchmark。特别是实时互动视频生成尚未形成统一评测标准,内部 benchmark 的 prompt 分布、角色风格、动作难度和偏好评价标准都会影响结果。

6.3 实时吞吐不是端到端交互延迟

42 FPS 是重要结果,但实时产品还要回答:

  • 用户说话后多久角色开始响应?
  • 是否使用 ASR,还是直接语音表征?
  • 新语音指令如何与正在生成的 motion plan 合并?
  • 网络抖动、服务排队和客户端解码如何影响延迟?
  • 多用户并发下成本如何变化?

论文主要证明生成侧吞吐,没有完整公布端到端 latency budget。

6.4 角色和场景边界不清楚

论文强调支持 real people、anime、pets,但没有详细拆分不同角色类型的成功率。宠物、二次元角色、真人半身像、全身人物、复杂背景、多人干扰都可能对模型造成不同挑战。尤其是宠物和动漫角色的动作语义与人类 gesture 不完全一致,需要单独评估。

6.5 安全与身份风险需要更强治理

这类系统天然涉及肖像、声音、身份克隆和实时生成。论文提到数据过滤 NSFW,但没有展开:

  • 用户上传真人照片和声音时如何做授权验证;
  • 是否支持水印或生成内容标识;
  • 如何防止冒充真人实时通话;
  • 如何处理未成年人、公众人物和敏感角色;
  • 是否有反滥用策略和审计机制。

对于可实时互动的 avatar,安全问题比离线视频生成更紧迫,因为它更接近“可对话的伪装身份”。

6.6 未来工作方向

值得继续推进的方向包括:

  • 建立公开实时互动视频 benchmark,包含端到端延迟、动作控制、长时稳定性和安全维度;
  • 报告 token / frame 级 latency breakdown,而不仅是平均 FPS;
  • 做 TwinCache、RoPE Repositioning、DMD、PCM、W8A8 GEMM 等模块消融;
  • 扩展到多人互动、物体交互和复杂环境,而不只是单人角色;
  • 加强授权、水印、身份保护和实时风控;
  • 探索更低端消费级 GPU、移动端或云边协同部署。

7. 实际应用场景和潜在影响

7.1 近期可落地场景

场景Vidu S1 的价值关键约束
虚拟主播 / AI 主播角色可实时听指令并做动作稳定性、内容安全、低延迟
在线教育老师 avatar 可随讲解做手势、表情和互动口型同步、知识正确性、互动延迟
游戏 NPCNPC 可根据玩家语音实时演出动作空间、引擎集成、成本
陪伴式 AI / 数字人通话更接近视频通话的连续体验身份安全、隐私、情绪表达
品牌 IP 互动品牌角色可直播互动和实时表演授权、风格一致性、并发服务
客服与导购比静态数字人更自然地解释产品合规、回答准确性、场景脚本

7.2 对视频生成行业的影响

Vidu S1 代表一个趋势:视频生成会从“内容生产工具”分化出“实时视觉交互引擎”。前者优化画质、可控编辑和成片效率;后者优化低延迟、长时稳定、在线控制和服务成本。二者的评价指标、系统架构和商业模式都会不同。

对创业公司和工程团队而言,这篇论文的启发是:

  • 如果目标是实时互动,不要只调模型;必须同时设计数据、蒸馏、cache、kernel、量化和 serving;
  • benchmark 要覆盖端到端体验,而不是只测离线视频质量;
  • avatar 系统的安全和身份治理要从第一天设计;
  • “实时”不能只写在产品文案里,至少要给出 FPS、首帧延迟、指令响应延迟、并发成本和稳定性曲线。

8. 相关工作和领域背景

8.1 离线视频生成基础模型

Sora、Veo、Wan、Seedance 等模型推动了大规模视频生成能力,但它们主要面向离线生成或较弱交互控制。Vidu S1 继承这一方向的视觉质量目标,但把重点转向持续交互和实时推理。

8.2 自回归 / 流式视频生成

Diffusion Forcing、FIFO-Diffusion、StreamingT2V、History-guided Video Diffusion、Self Forcing、Causal Forcing、LongLive、Magi-1、SkyReels-V2 等工作都尝试解决长视频或流式生成问题。Vidu S1 的区别是把语音控制、数字角色和系统实时性组合到一起。

8.3 Audio-driven avatar 与 talking head

HDTF、Wav2Lip、OmniAvatar、Hallo3、StableAvatar、LiveAvatar、Wan2.2-S2V 等工作关注音频驱动的人像动画、嘴型同步和身份保持。Vidu S1 与这些工作的关系是:它仍要解决嘴型和身份,但进一步要求角色能跟随动作指令,并在实时视频流中持续可控。

8.4 推理加速和 serving

TurboDiffusion、TurboServe、SageAttention、Sparse / Linear Attention、CUDA Graph、W8A8 quantized GEMM、Ulysses context parallelism 等构成了 Vidu S1 的系统支撑。没有这些底层工程,少步扩散模型也未必能达到产品级实时吞吐。

9. 总结

Vidu S1 是一篇偏系统实现的论文。它没有把所有细节开放到可复现程度,但清楚展示了实时互动视频生成需要解决的完整问题链:数据必须支持动作和音画一致,训练必须从双向质量先验过渡到因果流式生成,蒸馏必须把扩散模型压到少步,推理必须用固定窗口和缓存避免时长增长带来的成本爆炸,服务栈必须靠 kernel、量化、CUDA Graph 和多 GPU 并行把吞吐推到实时区间。

最值得记住的不是“42 FPS”这个单点数字,而是这篇论文给出的方向:未来的视频模型不只会生成视频,也会成为可以被实时操控的视觉角色引擎。 但若要成为可信的开放研究基线,Vidu S1 还需要更完整的公开 benchmark、消融实验、端到端延迟报告和安全治理说明。

参考资料