Kandinsky 6.0 Video
Kandinsky 6.0 Video 硅基写手Kandinsky 6.0 Video 用双流 CrossDiT 联合生成五秒视频与 44 kHz 音频,并以分阶段预训练、SFT、强化学习和两级蒸馏改善唇形同步与推理效率。论文开放 3B/29B 权重和代码,但原生分辨率、时长、消费级延迟及与顶尖闭源系统的差距仍限制实际部署。
论文基本信息
- 题目:Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation
- 作者:Team Kandinsky、Julia Agafonova、Bulat Akhmatov、Mikhail Aksyutin 等 88 位作者
- 机构:Kandinsky Lab
- 模型:Kandinsky 6.0 Video Lite(3B)与 Pro(29B)
- arXiv:2610.05608v1,2026 年 10 月 4 日提交,类别 cs.CV、cs.AI、cs.LG、cs.MM
- Daily Papers:Hugging Face 页面 2026 年 10 月 6 日榜首
- 开放情况:模型权重、训练与推理代码、Diffusers 集成均以 MIT 许可证发布;论文为 CC BY 4.0
- 链接:Hugging Face 详情页;arXiv 摘要页;arXiv HTML 全文;arXiv PDF 全文;项目主页;代码仓库;模型合集
一句话结论
Kandinsky 6.0 Video 的价值不只在于把音轨附加到视频,而是将预训练视频流与从零训练的音频流通过逐块双向注意力连接,再用面向音画同步的 SFT、强化学习和蒸馏把联合生成做成可开放部署的完整系统;它在语音、唇形和部分视觉指标上很有竞争力,但五秒时长、SD 原生生成、重度超分链路和明显的消费级延迟表明它仍更接近开放研究底座,而非全面追平闭源产品的生产模型。
背景与动机
视频生成模型已经能处理复杂场景、镜头运动和物体动态,但“先生成视频、再单独配音”的级联方案很难保证声音事件与画面动作发生在同一瞬间,更难同时满足口型、语义、情绪和环境声的一致性。真正的文本到音视频生成(Text-to-Audio-Video,T2AV)需要在同一生成过程中解决三种对齐:画面与提示词的语义对齐、声音与提示词的语义对齐,以及声音与画面在时间轴上的同步。
Veo 3.1、Sora 2、Wan 2.6 等闭源系统已经展示出自然对白、环境声与视觉事件的联合生成,但其模型、训练数据和工程细节不可复现。开放路线中,ALIVE、SyncFlow、JavisDiT、3MDiT、LTX-2/2.5、MiniMax-H3 与 Cosmos 3 分别探索了双向跨模态注意力、分层同步、统一多模态 Transformer 或流模型。问题在于,开放模型通常仍在片段长度、原生分辨率、音画同步和推理成本上落后。
论文选择了一条工程上务实的增量路线:保留 Kandinsky 5.0 已经学会的视频生成能力,新建音频分支,再逐步把两种模态接起来。这样可以复用昂贵的视频预训练结果,也把“是否必须从头训练一个统一音视频模型”改写为“如何在不破坏单模态能力的前提下融合两个生成流”。
核心贡献
- 发布同架构、不同规模的 Lite(3B)和 Pro(29B)模型,均支持 T2AV 与以首帧为条件的 I2AV,生成最长 5 秒、24 fps 左右的视频及同步 44 kHz 音频,并通过独立超分模块输出 Full HD。
- 提出双流 CrossDiT:视频与音频各有不对称 DiT 主干,每层通过 Video-to-Audio 与 Audio-to-Video 双向跨模态注意力交换信息,同时保留各自的文本注意力与位置编码。
- 给出连续预训练到后训练的完整配方:音频流从零训练、视频流继承 Kandinsky 5.0、联合 T2AV/I2AV 预训练、11 个领域的 SFT model soup、多目标强化学习,以及
π-Flow + Sim-LADD两阶段蒸馏。 - 构建独立的潜空间视频超分系统,由 Latent Upscaler 与无文本 SR-DiT 组成;SR-DiT 最终蒸馏到每个 tile 两次网络调用,可覆盖
×2、×2.25和×4路径。 - 在 VABench、人类成对偏好、强化学习消融、蒸馏消融、超分验证和多种 GPU 上报告结果,并开放权重、代码与 Diffusers 集成。
数据:真正的难点是同步筛选与联合标注
论文的数据管线不是一个单一音视频数据集,而是按训练阶段组合多种模态与质量层级:
| 数据用途 | 规模 | 关键处理 |
|---|---|---|
| T2I | 5000 万图像 | 从 Kandinsky 5.0 数据中筛选,去文字、水印与近重复,重写俄英双语、多粒度描述 |
| T2V | 2000 万视频片段 | 排除非标准帧率和场景切换,控制画质、运动与类别分布 |
| T2A | 4000 万条 5–20 秒音轨 | 从视频集合提取,过滤静音、损坏和低质量音频,生成声音描述 |
| T2AV | 700 万音视频片段 | 过滤音频质量、口型同步、事件同步与视觉质量,生成统一音画 caption |
| I2AV | 11.6 万首帧—音视频对 | 检查首帧画质、主体完整性与是否适合作为动作起点 |
| SFT Stage 1 / 2 | 4663 / 7686 个场景 | 前者强化视觉质量,后者增加语音与音乐并强化同步 |
| 强化学习 | 2984 个片段 | 俄英双语 caption、在线多种子 rollout、多目标奖励 |
| 超分 | 15 万个唯一片段 | 10 万 4K 视频、约 3.5 万 Kandinsky 5.0 视频、1.5 万合成相机运动片段 |
T2AV 筛选尤其关键。有人脸的片段只有在 Lip-Sync Alignment 不低于 3/5 时保留;包含音画事件的片段要求 Desync 低于 0.1。约 25% 的数据没有可见人脸,因此不要求口型。语音转录被放在 <S>...<E> 标记中,音频描述放在 <AUDCAP>...<ENDAUDCAP> 中,再由 Qwen3.5-35B-A3B 合并为同时描述视觉与声音的 caption。
这套流程说明,联合生成的核心资产不只是“有视频也有声音”,而是经过同步阈值过滤、带显式语音和声音描述的配对数据。与此同时,论文只给出数据来源类别与处理方法,没有公开完整训练数据或系统性的版权、地域和人口分布审计,因此开放权重并不等于训练数据完全透明。
方法:双流 CrossDiT 如何对齐声音与画面
1. 不对称双流主干
视频流继承 Kandinsky 5.0,音频流从随机初始化开始训练。两条流拥有相同数量的 Transformer block,但宽度不同:
| 版本 | 视频流 | 音频流 | 跨模态注意力 | 总参数 |
|---|---|---|---|---|
| Lite | 2B | 0.6B | 0.4B | 3B |
| Pro | 19B | 5B | 5B | 29B |
每个 block 中,视频和音频分别进行自身 self-attention、对文本 embedding 的 cross-attention、跨模态 attention 与 FFN。视频 query 读取音频 key/value 的 V2A 模块,以及音频 query 读取视频 key/value 的 A2V 模块,使声音既能依据画面事件生成,画面也能依据对白或声音结构调整。
视频由 Hunyuan VAE 编解码,音频使用支持 44 kHz 的 MMAudio autoencoder;文本同时使用 Qwen2.5-VL-7B-Instruct 与 CLIP ViT-L/14 编码。视频 token 使用三维 RoPE,音频 token 使用一维时间 RoPE。视频帧位置还按输入 fps 相对 24 fps 归一化,使不同帧率下的时间位置具有一致尺度。
I2AV 模式把参考首帧 latent 拼到待去噪视频 latent 的时间维上,以二值 mask 区分条件帧与生成帧,并增加 Token Role Embedding。论文的推理时消融显示,mask 与首帧的 RoPE 位置最关键;角色 embedding 的影响较弱且部分冗余。这是一个值得注意的负结果:模型识别“条件帧”的主要依据并不是额外角色 token,而是显式通道掩码和时间位置。
2. 连续预训练:先保住单模态能力,再学习联合生成
所有预训练阶段都使用 flow matching 与 MSE。训练顺序如下:
- 视频流从 Kandinsky 5.0 的 SD 预训练 checkpoint 继续学习 T2V;音频流在 4000 万音轨上从零学习 T2A。
- 音频流再用 T2AV caption 适配联合描述,视频流并行学习同一类 caption。
- 加入新初始化的双向跨模态注意力,联合训练 T2AV。Lite 训练 5.75 万步,Pro 训练 4.9 万步。
- 最后混入 25% I2AV 样本,Lite/Pro 分别继续 4000/5000 步。
联合训练使用 independent_time:视频和音频各自独立采样扩散时间,因此两种模态可以处于不同噪声水平。这不仅服务纯文本联合生成,也为“给定较干净的一种模态、生成另一种模态”的 audio-to-video 或 video-to-audio 条件形式提供训练信号。
3. SFT:按领域分别优化,再做 model soup
SFT 将数据分成 people action、people speech、animals、music、food、nature、cartoons 等 11 个领域,每个领域独立训练 checkpoint:
- Stage 1 只优化视频流,冻结音频流与融合模块,训练 7000 步,目标是提升视觉质量;
- Stage 2 解冻全部模块,继续训练 5000 步,以
0.85 视频损失 + 0.15 音频损失 + 1.0 人脸区域损失强化同步与口型; - 直到 Stage 2 结束,才对 11 个领域 checkpoint 做均匀权重平均,得到最终 SFT 模型。
这种设计避免某一领域的数据分布在联合微调中占据主导,但 model soup 的均匀平均也隐含假设:各领域参数更新处在可兼容的局部区域。论文没有与单一混合数据 SFT 或非均匀权重 soup 做完整对照,因此无法单独量化 model soup 的贡献。
4. 强化学习:为视频、音频和同步分别路由奖励
强化学习改造自 OmniNFT。每个提示生成一组不同随机种子的音视频,Pro 使用 10 个 rollout,Lite 使用 8 个。八项奖励分为三支:
- 视频:HPSv3、VideoAlign;
- 音频:AudioBox Aesthetics、CLAP、Whisper-ASR;
- 同步:AV-desync、AV-align、由语音可懂度门控的 LatentSync。
各奖励先在组内中心化,再用 batch 标准差缩放。同步奖励同时进入视频和音频 advantage,最终广播为逐 token 奖励。模型通过 rank 16、alpha 32 的 LoRA 更新;Pro 可训练约 199M 参数,占总参数 0.69%。A2V 注意力图还被用来提高脸、手和乐器等音画相关区域的损失权重,上限为 1.5 倍。
为避免视频梯度破坏音频表征,作者对部分 V2A block 的 key/value 路径做分层梯度缩放。这个分区不是照搬 LTX-2,而是通过逐 block 消融与梯度泄漏测量重新标定。它揭示了联合训练的一个实际难题:共享跨模态模块并不自动意味着两个模态的优化方向兼容。
5. 两阶段蒸馏:10 次基础模型调用与 2 次超分调用
基础生成模型先用 π-Flow 做 on-policy 轨迹模仿,把教师采样压缩到 10 次网络函数求值(NFE)。随后使用论文提出的 Sim-LADD:判别器读取冻结教师中间层的多尺度 latent 特征,学生从自己真实会遇到的反向去噪状态开始训练,并只对最后 5 个 solver step 反向传播,以降低显存占用。π-Flow 保留全局语义、运动与多样性,Sim-LADD 负责补回少步采样损失的纹理和局部对比度。
超分是另一套模型。Latent Upscaler 先在 K-VAE latent 空间确定性放大 ×2 或 ×4,无文本 SR-DiT 再去除退化并恢复细节。它通过 NABLA 稀疏注意力降低长时空序列成本,并用 π-Flow DX 蒸馏到每个 tile 两次模型调用。Full HD 的 ×2.25 路径实际是先在像素空间双线性放大 ×1.125,再走 ×2 latent 超分,最后缩放到目标尺寸。
推理与部署:能在消费级显卡运行,不等于接近实时
基础模型原生输出为 864×480、480×864 或 512×512,Full HD 来自独立超分。Pro SD 的常驻推理峰值达到 72.8 GiB;block offloading 每次只把两个 Transformer block 放在 GPU 上,并把下一 block 的传输与当前计算重叠。配合文本编码器 NF4 量化和 SR 空间切片,论文给出 32 GB、24 GB 与 16 GB 三档预设。
在 16 GB 预设下,PyTorch 分配峰值按模式为 7.9–13.7 GiB,但 Pro 仍需要约 58 GiB 主机内存保存完整权重与 pinned copy;如果内存被换页到磁盘,推理会严重变慢。论文对 5 秒视频的实测时间如下,均为热身后、不含权重加载和 MP4 编码的完整非蒸馏基础模型:
| 硬件 | Lite SD | Lite Full HD | Pro SD | Pro Full HD |
|---|---|---|---|---|
| RTX 4090 24 GB | 437 秒 | 578 秒 | 936 秒 | 1247 秒 |
| RTX 5090 32 GB | 309 秒 | 406 秒 | 754 秒 | 854 秒 |
| H100 80 GB | 239 秒 | 284 秒 | 356 秒 | 402 秒 |
这些数字证明“可运行”,却也明确排除了实时交互:即便 H100 上的 Lite SD,也需要约 239 秒生成 5 秒内容。不同 GPU 使用的 attention backend、offloading 与编译设置不同,表格不能被理解为严格硬件基准。论文另称蒸馏 checkpoint 保持质量,但性能表明确使用完整非蒸馏模型,因此不能把 10 NFE 直接换算成表中的加速比。
实验结果
VABench:同步和视觉真实感强,综合语义评价并非全面领先
论文在 VABench 上比较最终 RL checkpoint:Kandinsky 两个版本以 512×768 生成,LTX 2.5 使用两阶段 Full HD 配置。不同分辨率与管线并不完全等价,因此结果更适合判断能力侧重,而不是单一总排名。
| 指标 | LTX 2.5 | Kandinsky Lite | Kandinsky Pro | 最优方向 |
|---|---|---|---|---|
| Speech quality | 1.427 | 1.477 | 1.496 | 高 |
| Audio aesthetics | 3.307 | 3.323 | 3.345 | 高 |
| Text-video alignment | 0.185 | 0.227 | 0.229 | 高 |
| Text-audio alignment | 0.307 | 0.374 | 0.367 | 高 |
| Audio-video alignment | 0.258 | 0.245 | 0.268 | 高 |
| Lip-sync | 1.567 | 1.761 | 2.072 | 高 |
| Desync | 0.521 | 0.474 | 0.396 | 低 |
| VLM alignment | 4.527 | 4.351 | 4.329 | 高 |
| Expressiveness | 4.360 | 4.334 | 4.312 | 高 |
| Visual realism | 4.366 | 4.459 | 4.485 | 高 |
| Audio realism | 3.663 | 3.900 | 3.893 | 高 |
| Audio quality | 0.688 | 0.697 | 0.630 | 高 |
| Visual quality | 0.617 | 0.691 | 0.652 | 高 |
| WER | 0.099 | 0.103 | 0.117 | 低 |
Pro 在口型、不同步程度、文本—视频与音频—视频对齐上表现突出;Lite 反而拿到最佳的音频真实感、音频质量和视觉质量。LTX 2.5 仍在 VLM 评分的总体对齐、表现力以及额外计算的 WER 上领先。这里的 WER 使用 Qwen3-ASR-1.7B,而强化学习章节的 WER 使用 Whisper-large-v3,两个数字不能直接互相验证。
强化学习:语音改善显著,但评估器并非完全独立
在 64 个保留语音提示、每个 3 个种子的内部测试中,Pro 的 Whisper WER 从 SFT 的 0.235 降至 0.124,相对下降 47%;Lite 从 0.179 降至 0.127,相对下降 29%,两者配对 Wilcoxon 检验均为 p < 10^-3。在 100 条公开 Harvard sentences 上,Pro 从 0.251 降到 0.180,p = 0.005。
这是论文最明确的量化收益之一,但 Whisper-ASR 同时属于强化学习奖励,因此内部 Whisper WER 存在 reward-model 对齐带来的评估偏好。Harvard sentences 的外部提示集减轻了数据重合疑虑,却仍使用同一 ASR 家族判分。VABench 上改用 Qwen ASR 后,Pro WER 又落后 LTX 2.5,说明“语音改善”可信,“语音整体最佳”则不应扩大解释。
人类成对评测:相对前代与 LTX 2.5 的进步清楚,对闭源模型是互有胜负
人类评测将同一提示的两个匿名视频并排展示,左右随机;标注者先静音评价视觉,再打开声音评价语音、同步、音质、声音提示遵循和整体任务完成度。每项大约收集 200 组或更多比较,并以多数票聚合。
- 相比 Kandinsky 5.0 Pro,新模型在 T2V/I2V 的视觉质量、伪影、运动、提示遵循和参考图保持上全面领先。
- 相比 LTX 2.5,Kandinsky Pro 在视觉质量、伪影、运动、视觉提示遵循、任务完成和语音质量上领先;LTX 的一般音质和同步略占优,但后三项差异未达到显著。
- 相比 Kling 2.6,Kling 的视觉美感和一般音频质量更好,Kandinsky 的声音提示遵循更强,部分指标接近持平。
- 相比 Veo 3.1 Fast,Kandinsky 更少伪影、I2AV 参考图保持更好;Veo 在提示遵循、一般音频与整体任务完成上更强。
- MiniMax H3 和 Seedance 2.0 在多数视觉指标上明显领先;Kandinsky 仍在语音质量和部分同步指标上有竞争力。
论文没有在正文表格中给出所有人评的具体胜率、样本构成和标注者一致性,而主要以图形与显著性叙述呈现。因此这些结果足以支持“优势侧重不同”,不足以压缩成一个绝对排行榜。
蒸馏与超分:质量大致保住,但客观指标存在权衡
I2AV 人评中,10 NFE 蒸馏模型相对完整模型的跨指标平均偏好为 51% 对 49%,没有单项差异达到 0.95 或 0.975 显著性水平。它在参考图一致性和伪影上略好,完整模型在视觉提示遵循与任务完成上略好。这支持“蒸馏未造成可辨识的总体退化”,但不是蒸馏提升质量的证据。
SR-DiT 的 ×4 路径从 dense attention 到 NABLA 再到两次 NFE 蒸馏后,MUSIQ 从 48.92 提升到 50.41,CLIP-IQA 从 0.4426 提升到 0.4587;同时 warp error 从 0.6141 升到 0.6781。作者强调 warp error 同时受细节与光流估计影响,不能单独等同于时间闪烁。×2 路径各阶段没有一致提升,说明超分收益依赖倍率与输入分布。
局限与审慎解读
- 片段只有 5 秒。 121 帧上限回避了长镜头中的角色、声源、说话人身份和事件因果一致性问题,也无法证明多镜头叙事能力。
- Full HD 不是原生生成。 基础模型在 SD latent 上工作,最终画质依赖独立、分 tile、带生成先验的超分模型。超分可能恢复细节,也可能生成输入中不存在的纹理。
- 开放模型与最强闭源系统仍有差距。 作者自己的 SBS 结果显示 MiniMax H3、Seedance 2.0 在视觉维度更强,Veo 3.1 Fast 在提示遵循和音频上占优。
- VABench 对比范围窄且配置不统一。 数值表只比较 LTX 2.5 与 Kandinsky Lite/Pro,而且 Kandinsky 是 512×768、LTX 是两阶段 Full HD。模型规模、采样计算量和分辨率没有统一控制。
- RL 评价存在奖励泄漏风险。 Whisper-ASR 既是训练奖励又是主要 WER 评估器;多个美学与对齐模型同样参与训练目标,可能让指标改善高估人类感知收益。
- 数据透明度有限。 论文披露了规模、过滤器与 captioner,却没有公开完整训练集、许可分布、人物同意机制或数据去重审计。大规模网络视频也可能携带人口、语言和文化偏差。
- 消费级部署成本仍高。 block offloading 解决显存容量,不解决 PCIe 传输与计算时间。16 GB 模式还需要约 58 GiB 主机内存,5 秒片段的生成时间以分钟计。
- 人评报告不够完整。 各比较约 200 个样本,但具体每项样本数、提示分层、标注者数量、一致性和完整胜率主要未以正文表格给出。
- 安全风险随音画同步增强。 自然语音与口型同步会降低伪造门槛。论文列出不得冒充真人、生成非自愿私密内容或违法内容等伦理原则,但没有提供水印、来源凭证、滥用评测或模型层安全机制的实证结果。
应用影响
Kandinsky 6.0 Video 适合开放研究、创意分镜、短广告原型、游戏过场草案、教育演示和音效预可视化。I2AV 可以让单张角色或场景图发展成带对白和环境声的短片;T2AV 则减少传统“画面生成—音效搜索—对白合成—手工对齐”的多段工作流。
它对开源社区更重要的影响在系统层面。论文不只交付一个 checkpoint,还公开了联合数据标注格式、连续预训练方案、分领域 SFT、模态奖励路由、跨流梯度保护、少步蒸馏、latent 超分与显存预设。这些组件使后续研究可以分别替换音频编码器、同步奖励、蒸馏方法或超分模块,而不必从头重建整个音视频生成栈。
实际产品仍需增加论文未解决的治理层:默认嵌入可验证的内容来源信息,对真人外貌和声音提供同意校验,为输出显式标注合成属性,对提示、模型和 seed 留存审计记录,并在公开服务中加入人物冒充、未成年人、非自愿内容和版权素材的防护。联合生成让创作更简单,也让“声音来自谁、画面是否真实”更难凭感官判断。
相关工作
Kandinsky 6.0 Video 延续了三条路线。第一条是从 latent diffusion、DiT 到时空视频 Transformer 的视觉生成路线,它直接复用 Kandinsky 5.0 的 CrossDiT 与 NABLA 稀疏注意力,并与 HunyuanVideo、Wan、CogVideoX 等开放视频模型共享技术背景。
第二条是联合音视频生成。SyncFlow 强调时间对齐的 flow 架构,JavisDiT 使用分层时空同步先验,3MDiT 采用统一三模态 Transformer,Ovi 与 LTX-2 使用双流跨模态融合。Kandinsky 的差异是明确保留预训练视频分支、从零训练较小音频分支,再通过 blockwise 双向注意力融合;这降低了重建视觉能力的成本,却带来跨分支梯度干扰问题。
第三条是生成模型后训练与少步采样。领域 SFT 与 model soup 用少量高质量数据校正分布,OmniNFT 式 RL 以多模态奖励改善可懂度和同步,π-Flow 以 on-policy 模仿压缩轨迹,Sim-LADD 再用真实数据和对抗目标恢复纹理。独立 SR 模块则承接 Real-ESRGAN 式合成退化、视频时间退化和 latent diffusion 超分的研究积累。
总结
Kandinsky 6.0 Video 是一份覆盖数据、架构、训练、后训练、蒸馏、超分和部署的完整开放音视频生成报告。最有说服力的结果是:双流 CrossDiT 可以在保留既有视频能力的同时加入 44 kHz 音频生成,RL 对语音可懂度带来可测且显著的改善,蒸馏没有在人类偏好中显示出显著质量损失,权重与代码也已经公开。
最重要的判断边界同样清楚:它生成的仍是五秒 SD 短片,Full HD 依赖生成式超分,消费级运行速度以分钟计;VABench 与人评显示它擅长口型、语音与部分视觉质量,却没有全面超过 LTX 2.5,更未全面追平领先闭源系统。因而这项工作的现实定位,是把同步音视频生成从少数闭源产品能力推进为可检查、可修改、可复现的开放工程基线。