SemComp-Bench
SemComp-Bench 硅基写手基于 Hugging Face Daily Papers 2026-08-20 榜首论文,深入解析 SemComp-Bench 如何把视频生成评测从“看起来真实”推进到“真正完成任务”,并审视其 1,273 条数据、双指标 VLM 裁判、模型对比、参考图条件效应与证据局限。
自动研究时间:2026-08-21 09:01(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Aug 20,列表最顶部为 SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation。
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> arXiv v1 HTML 全文与 PDF -> 官方项目页与代码仓库。
执行摘要
当一个视频生成模型收到参考图和“把这张钞票折成一只乌龟”的指令,结果视频可能画质精致、动作流畅,甚至出现了一只逼真的乌龟,但它仍然没有完成任务:画面中的乌龟可能与输入钞票毫无关系,或者钞票在中途被另一个物体替换。现有视频生成基准擅长衡量清晰度、运动、时序一致性和 prompt 对齐,却较少同时追问两个更接近真实使用的问题:指定结果是否真的出现,以及这个结果是否仍然建立在参考内容之上。
SemComp-Bench 将这一缺口定义为 Semantic Task Completion Video Generation。它不要求模型完整复现中间操作过程,而是聚焦可见的完成状态;同时用“语义落地”约束结果必须保留任务相关的对象、身份、外观或场景关系。为了把这一问题变成可评测任务,作者从约 2 万条 Koala-36M 视频中构建 1,273 个 SemComp-Data 实例,每条包含参考帧、简短指令、详细指令和来自同一原视频的结果中心视频片段,并从六个领域平衡抽取 60 条形成 SemComp-Core。
评测把“做成了什么”和“视频做得稳不稳”拆为两组指标。Outcome Achievement(OA)要求结果实现、语义落地、关键实体一致性、全局视觉连续性四项全部通过;Generation Reliability(GR)则平均物理合理性、视觉清晰度、无伪影、场景内时空一致性、文字与界面完整性五项。每个生成视频均匀抽取 27 帧,由 Doubao-Seed-1.8 进行三次独立二元判断并给出视觉证据。
实验最醒目的结论是:“看起来可靠”和“真正完成任务”是两种不同能力。 Seedance 2.0 的 GR 最高,达到 91.8%,但 OA 只有 20.0%;HunyuanVideo-1.5-720P-I2V 的 OA 最高,也仅为 37.8%,其 GR 为 79.1%。所有模型的最佳 OA 仍低于 40%,而场景内时空一致性的通过率只有 32.8%–73.9%。此外,在同一模型家族内,参考图条件显著提升语义落地、实体一致性和全局连续性;详细指令能提高任务完成,却也增加协调生成难度。
论文的价值不只是增加一个排行榜,而是改变评测问题:从“生成视频像不像真的”转向“视频是否把给定对象带到了指定结果”。但证据边界也很明确:核心集只有 60 条,任务集中在视觉可验证的制作与状态变化;数据构造和最终裁判都依赖同一个 VLM;每个设置只生成一次,三次重复发生在评分端而非生成端;正文没有给出大规模人工评审一致性校准。因此,SemComp-Bench 更适合作为现有质量基准的补充维度,而不是单独取代人工评审或过程正确性、安全性评测。
1. 论文基本信息
| 项目 | 内容 |
|---|---|
| 论文标题 | SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation |
| 论文编号 | arXiv:2608.17426 |
| 当前版本 | v1,2026-08-18 提交 |
| Hugging Face 状态 | 2026-08-20 Daily Papers 列表最顶部、#1 Paper of the day |
| 作者 | Keyu Tu、Zhuowei Chen、Mengqi Huang、Yuxin Wang、Jiahao Zhu、Zhendong Mao、Yongdong Zhang |
| 机构 | University of Science and Technology of China、FrameX.AI、Sun Yat-sen University |
| 主分类 | Computer Vision and Pattern Recognition(cs.CV);同时归入 Artificial Intelligence(cs.AI) |
| 核心任务 | 在参考图语义约束下生成可见地达到指定结果的视频 |
| 数据资产 | SemComp-Data 1,273 条;SemComp-Core 60 条 |
| 评测指标 | Outcome Achievement(OA)与 Generation Reliability(GR) |
| VLM 裁判 | Doubao-Seed-1.8,经 Volcano Engine API 调用 |
核心链接:
- Hugging Face 详情页:https://huggingface.co/papers/2608.17426
- arXiv 摘要页:https://arxiv.org/abs/2608.17426
- arXiv HTML 全文:https://arxiv.org/html/2608.17426v1
- arXiv PDF:https://arxiv.org/pdf/2608.17426
- 官方项目页:https://semcomp-bench.github.io/
- 官方代码仓库:https://github.com/Kelly372/SemComp-Bench
2. 背景与动机:从生成质量走向结果责任
2.1 传统指标没有直接回答“任务做完了吗”
视频生成评测已经覆盖多个维度:单帧视觉质量、时序一致性、文本—视频对齐、主体身份保持、指定运动、物理合理性和因果常识。问题在于,这些分数往往围绕“生成内容是否像目标描述”或“视频是否稳定”展开,没有把参考图、指令与完成状态组成一个必须共同成立的关系。
以“将参考钞票折成乌龟”为例,至少有三种容易被传统指标高估的结果:
- 视频很清晰,但最终没有出现折纸乌龟;
- 最终出现乌龟,却不是由参考钞票形成,输入实体被替换;
- 首帧复制参考图,后续突然切换到无关成品,缺少语义和全局连续性。
SemComp-Bench 认为,真正成功必须同时满足结果实现与参考语义落地。这里的“落地”不是像素级复制:任务无关的背景、镜头或装饰可以改变,但身份、材料、构成、数量、结构等任务相关属性必须以正确方式保留或改变。
2.2 结果导向不等于过程复现
论文有意把任务边界设在“完成状态”,而不是完整操作过程。生成视频无需逐步展示每次折叠、烹饪或组装动作,只要可见证据足以证明目标结果已出现,并且结果仍与参考上下文相连。
这个设计带来两个好处。第一,许多生成模型的时长有限,强制复现完整长程程序会把时长能力与任务完成混为一谈。第二,同一个结果可以由多种合理过程得到,评测终态能避免把某一条演示路径误当作唯一标准答案。
代价也同样明确:若应用关心操作是否安全、步骤是否物理可行、顺序是否正确或中间是否发生违规行为,SemComp-Bench 不会给出答案。它测的是“终态语义完成”,不是完整的程序验证。
2.3 为什么要从完整真实视频构造参考—结果对
若参考图和结果视频从不同来源独立拼接,目标可能根本不可实现,或两者在身份、材料、场景上天然不匹配。作者因此从同一条完整视频中抽取参考帧与结果中心片段。这一选择同时提供了三种保证:
- 真实视频已经证明该任务在给定上下文中可完成;
- 参考实体与结果实体具有真实关联,而非事后匹配;
- 可以从同一素材精细识别哪些属性应该保持、哪些属性允许变化。
这让 SemComp-Data 更像一组可验证的“初始状态—目标状态”任务,而不是普通 caption-video 对。
3. 核心贡献
3.1 提出 Semantic Task Completion Video Generation
论文把视频生成重新表述为结果导向任务:给定参考图与指令,模型要生成一个可见地实现目标结果、并与参考图保持任务相关语义关系的视频。这个定义把“结果是否发生”与“结果是否属于给定对象”同时纳入成功条件。
3.2 构建同源、双指令的 SemComp-Data
每个数据实例写作三元组:
其中, 是参考帧, 是结果中心视频片段, 同时包含简短指令和详细指令。两种指令描述同一个目标,因此可以在不改变参考与结果的情况下,单独研究指令具体程度的影响。
数据覆盖六个领域、21 个细分类别:
| 领域 | 代表类别 |
|---|---|
| Food and Cooking | 菜品制作、食物状态变化、摆盘 |
| Beauty and Fashion | 造型、工具清洁、试穿、产品展示 |
| Sports and Fitness | 装备设置、身体准备、体育编辑 |
| Crafts and DIY | 组装、修复、装修、蓝图施工、材料塑形 |
| Gardening and Pets | 植物养护、花艺、宠物美容 |
| Arts and Precision | 艺术创作、数字创作、雕塑 |
3.3 用两组互补分数拆开“完成”与“可靠”
OA 对任务语义负责,GR 对生成质量负责。二者并列报告,而不是混成单一总分,因此可以区分“画面稳定但没完成”“完成了但过程画面不稳定”“两者都失败”等不同模型画像。
3.4 采用结构化二元 VLM 问答提供可解释诊断
与让 VLM 直接给一个 1–10 分相比,SemComp-Bench 为每个标准提出明确的是非问题,并要求裁判给出可见证据。二元判断降低了分数尺度漂移,标准级输出则能定位失败究竟来自结果未实现、实体漂移、场景跳变、物理异常还是局部伪影。
3.5 对模型、条件模态与指令粒度进行受控比较
作者评测七种代表性开放与闭源模型,并在 Wan2.2、CogVideoX1.5 和 HunyuanVideo-1.5 三个家族上比较 I2V、详细指令 T2V、简短指令 T2V,直接量化参考图和指令具体程度带来的差异。
4. SemComp-Data:四阶段构造流程
4.1 阶段一:Candidate Filtering
作者从 Koala-36M 随机抽取约 2 万条视频。由于任务结果必须能从画面验证,首先用 45 个大小写敏感的关键词过滤新闻、访谈、播客、reaction、vlog 等依赖叙述或非视觉上下文的内容。随后均匀采样视频帧并拼成 video abstract,由 VLM 将候选划入六个领域和对应类别;视觉证据不足的样本标为 Uncertain 并丢弃。
每个细分类别再由人工定义参考状态与结果状态。例如,Assembly 的参考状态是分离或部分组合的组件,结果状态是完整结构;Pet Grooming 要求同一只宠物从美容前转为可见的完成状态。这些定义为后续时间定位提供任务特定的判断标准。
4.2 阶段二:State Mining
State Mining 不直接让 VLM 找完整结果区间,而是先定位最能代表参考状态和结果状态的两个时间戳。这样,VLM 只需判断静态证据,不必同时解决动作分段和边界模糊问题。
时间戳定位后,系统抽取两帧进行保守质量检查:把未标记的帧对和任务描述交给 VLM,让它判断哪一帧代表结果。如果预测与原定位的结果帧不一致,样本就被丢弃。这个反向问答相当于一道可辨识性门槛,避免把模糊或缺少视觉证据的前后状态纳入数据。
4.3 阶段三:Video Extension
系统参考 Panda-70M 的镜头检测和同场景合并方式,把完整视频切成视角一致的片段。以已验证的结果时间戳为锚点,选中包含结果帧的核心片段,并合并视觉一致的邻近片段,得到至少约 3 秒、集中呈现完成状态的视频。
最终片段时长统计为:最短 3.020 秒、中位数 4.067 秒、平均 4.033 秒、最长 4.125 秒。它足以提供少量时序证据,又尽量排除漫长中间过程和无关内容。
4.4 阶段四:Instruction Structuring
作者发现,直接从参考帧和结果片段生成说明容易夹带品牌、屏幕文字和偶然背景。于是将指令构造拆成三步:
- Normalized Relation Description:生成不超过 30 个词的简短指令,遵循“动词 + 参考主体 + 介词 + 结果状态”;
- Attribute Selection:从四种语义对齐类型中选择一种,并判断参考属性哪些必须保留、哪些可忽略;
- Instruction Composition:结合对齐约束与结果的背景、光线、颜色、形状和部件细节,扩展为详细指令。
四种对齐类型分别是 Object Element、Identity、Object Appearance 和 Scene。完整属性词表有 17 项,覆盖对象类别、构成、数量、材料、色彩、形状结构、表面、图形细节、人物身份、面部、身体、姿态、场景类型、布局、空间关系、背景和视角。
这套拆分的关键不是让所有参考属性都不变,而是明确“为了证明这是同一个任务,哪些属性必须保持语义连续”。
5. SemComp-Bench:九个标准、两个分数
5.1 Outcome Achievement
OA 包含四个二元标准:
| 标准 | 关注问题 |
|---|---|
| Outcome Realization | 指令要求的完成状态是否在视频中清楚出现 |
| Semantic Grounding | 结果是否按参考图与指令正确保留或改变任务相关实体与属性 |
| Grounded Entity Consistency | 关键实体是否在序列中保持可识别,没有无故消失、替换或语义漂移 |
| Global Visual Continuity | 场景、视角、布局、背景或构图是否没有突兀的整体切换 |
对第 个样本,只有四项全部通过才算 OA 成功:
这种合取定义很严格。某模型即使能实现结果,只要参考实体被替换或画面全局跳变,样本级 OA 仍为 0。它适合表达端到端任务成功,但也会放大任何一个 VLM 判断错误对总分的影响。
5.2 Generation Reliability
GR 包含五个独立标准:
| 标准 | 关注问题 |
|---|---|
| Physical Plausibility | 动作、接触、交互和材料行为是否明显违反基本物理 |
| Visual Clarity | 是否因模糊、曝光、分辨率或细节不足而难以辨认 |
| Artifact-Free Rendering | 是否存在异常噪声、破损区域、空白块或色带 |
| Within-Scene Spatiotemporal Coherence | 连续场景内是否闪烁、短暂复制或局部几何变形 |
| Text and Interface Integrity | 文字、数字、图标和界面元素是否损坏或不可识别 |
GR 不要求五项同时通过,而是取均值:
因此 OA 是任务成功率,GR 更接近可靠性健康度。GR 中一个强项可以部分补偿一个弱项,阅读排行榜时必须继续查看标准级通过率。
5.3 VLM 裁判协议
每个 720p 生成视频均匀采样 27 帧并按时间顺序输入裁判。结果实现与语义落地还接收参考图和指令;实体一致性、全局连续性与 GR 标准主要查看帧序列。裁判只能回答 yes 或 no,并要引用视觉证据。
所有结果用三个不同时间发起的独立 VLM 调用重复评分,再对三次 run-level 分数求平均。需要注意,这只降低裁判调用的随机性:论文在每个模型—样本设置下只生成一个视频,没有通过多次采样估计生成模型本身的方差。
6. 实验设置
SemComp-Core 从 1,273 条数据中按领域分层抽取 60 条,每个领域 10 条,并尽量保持领域内对齐类型分布。每条同时拥有简短和详细指令。
主实验在参考图 + 详细指令的 I2V 条件下评测七个模型:
- Seedance 2.0;
- Wan2.2-TI2V-5B;
- Wan2.2-I2V-A14B;
- CogVideoX1.5-5B-I2V;
- SkyReels-V2-I2V-14B-720P;
- HunyuanVideo-1.5-720P-I2V;
- Phantom-1.3B。
开放模型使用官方默认推理配置,闭源模型使用对外暴露的默认设置;支持显式随机种子的系统使用固定 seed。每个实例只生成一个 720p 视频。数据构造与评测均使用 Doubao-Seed-1.8,作者将其选择归因于初步实验中的效率—成本权衡。
条件消融选取 Wan2.2-A14B、CogVideoX1.5-5B 和 HunyuanVideo-1.5-720P 三个同规模模型家族,对比:
- 参考图 + 详细指令的 I2V;
- 只有详细指令的 T2V;
- 只有简短指令的 T2V。
7. 核心实验结果
7.1 最佳任务完成率仍低于 40%
| 模型 | OA Score | GR Score |
|---|---|---|
| Seedance 2.0 | 20.0% | 91.8% |
| Wan2.2-TI2V-5B | 23.3% | 85.4% |
| Wan2.2-I2V-A14B | 28.3% | 89.0% |
| CogVideoX1.5-5B-I2V | 14.4% | 78.8% |
| SkyReels-V2-I2V-14B-720P | 22.8% | 71.1% |
| HunyuanVideo-1.5-720P-I2V | 37.8% | 79.1% |
| Phantom-1.3B | 3.9% | 76.8% |
HunyuanVideo-1.5 的 OA 最高,但也只有 37.8%。它的四项 OA 通过率相对均衡:结果实现 87.8%、语义落地 70.6%、实体一致性 58.3%、全局连续性 79.4%。合取指标说明,任何一项短板都会迅速压低端到端成功率。
Seedance 2.0 的结果实现率为 83.9%、语义落地为 74.4%,并不弱;真正拉低 OA 的是实体一致性 44.4% 和全局连续性 59.4%。这意味着它常能生成“语义上像目标”的局部画面,却没有把关键实体和场景稳定地带到结尾。
7.2 可靠性排名与任务完成排名明显错位
Seedance 2.0 的 GR 达 91.8%,比 HunyuanVideo-1.5 高 12.7 个百分点,但 OA 反而低 17.8 个百分点。HunyuanVideo 在 OA 排第一、GR 仅排第五;Wan2.2-I2V-A14B 则在两项均排第二,是本实验中最均衡的模型。
这个错位支持论文的核心主张:高清晰度、少伪影和较好的物理观感,并不会自动转化为任务成功。若产品只使用传统生成质量分数选型,可能选中“视频最好看但任务经常没做完”的模型。
7.3 场景内时空一致性是共同瓶颈
七个模型的视觉清晰度和无伪影通过率普遍较高,但 Within-Scene Spatiotemporal Coherence 只有 32.8%–73.9%。最低的是 SkyReels-V2 的 32.8%,最高的 Seedance 2.0 也只有 73.9%。
这反映出当前模型已经能生成质量不错的单帧,却仍难在连续场景中保持物体几何、局部结构和运动演化稳定。对于涉及折叠、塑形、组装、烹饪等状态变化的任务,这种局部漂移会直接破坏“同一个实体完成了变化”的证据链。
7.4 参考图对语义落地和连续性至关重要
| 模型家族 | 条件 | OA Score |
|---|---|---|
| Wan2.2-A14B | I2V + 详细指令 | 28.3% |
| T2V + 详细指令 | 4.4% | |
| T2V + 简短指令 | 0.6% | |
| CogVideoX1.5-5B | I2V + 详细指令 | 14.4% |
| T2V + 详细指令 | 5.0% | |
| T2V + 简短指令 | 0.6% | |
| HunyuanVideo-1.5-720P | I2V + 详细指令 | 37.8% |
| T2V + 详细指令 | 4.4% | |
| T2V + 简短指令 | 1.7% |
三个模型家族的 I2V 都显著优于 T2V。差距主要来自语义落地、实体一致性和全局连续性,而非单纯的结果实现:两个家族的 T2V 结果实现率甚至略高。这是一个重要区分——文字可以告诉模型“要生成什么结果”,参考图则提供“哪个对象、哪些属性和什么场景关系必须贯穿结果”的锚点。
7.5 详细指令提高完成率,也提高生成难度
在 T2V 设置内,详细指令的 OA 始终高于简短指令,主要改善结果实现与语义落地。例如 Wan2.2 的 OA 从 0.6% 升至 4.4%,HunyuanVideo 从 1.7% 升至 4.4%。
但简短指令有时在实体一致性和全局连续性上更高,因为约束更少、场景更容易稳定生成。详细描述能更精确地规定组合目标,却同时要求模型协调更多对象、属性与空间关系。评测结果揭示的是“定义清楚”与“生成容易”之间的真实张力,而不是指令越长越好。
7.6 三次裁判调用仍存在可见波动
补充材料报告三次 VLM 评分的样本标准差。详细指令条件下,OA Score 标准差约 0.96–4.41 个百分点,GR Score 约 1.35–7.20 个百分点;部分单项更高,例如 Phantom 的场景内时空一致性达到 15.84 个百分点,CogVideoX 的视觉清晰度达到 13.47 个百分点。
这说明结构化二元问题没有消除裁判不确定性。报告均值是必要的,但在模型差距很小时,还应同时查看方差、人工复核和样本级证据,避免把裁判波动解释成真实能力差异。
8. 局限与证据边界
8.1 SemComp-Core 只有 60 条
核心评测每个领域仅 10 条。它适合快速比较和失败诊断,但对 21 个细分类别、不同对齐类型和长尾难度的覆盖有限。排行榜中几个百分点的差距可能由少数样本决定,尤其 OA 是严格的样本级合取成功率。
8.2 数据域偏向视觉可验证的手工任务
关键词过滤主动排除了新闻、访谈、播客、vlog 等内容,保留下来的六个领域又以制作、改造、造型和状态变化为主。这与任务定义一致,却限制了外推范围。医疗操作、工业流程、软件界面任务、长程规划和依赖非视觉知识的任务未得到充分验证。
8.3 构造者与裁判共享同一个 VLM
Doubao-Seed-1.8 参与视频分类、状态定位、指令生成和最终评分。共享模型能降低工程复杂度,却可能带来共同偏好:它生成的表述方式可能也更容易被自己理解,它筛选出的视觉证据可能与自身判断边界一致。正文没有报告大规模独立人工裁判或多 VLM 交叉校准,因此绝对分数仍依赖裁判模型。
8.4 三次重复测的是裁判,不是生成器
每个模型在每个实例上只生成一条视频,之后由 VLM 调用三次。视频生成通常对随机种子敏感,单次生成无法估计 pass@k、最好样本、平均样本或失败概率。固定 seed 提升可复现性,但不能代表用户多次生成时的分布。
8.5 二元标准清晰,但聚合方式带有价值判断
OA 要求四项全部通过,任一误判都会让样本归零;GR 使用平均值,一个维度的失败可被其他维度补偿。两种聚合分别体现“任务成功不可缺项”和“可靠性可以分项诊断”的设计选择,但不同应用可能需要加权、门槛或风险敏感指标。
8.6 终态评测不验证过程正确性
论文明确允许省略中间步骤。因此,一个结果看似完成但中间动作危险、不可能或违反用户约束的视频,仍可能得到较高 OA。机器人学习、操作教学和安全关键模拟必须另加过程完整性、动作因果性与安全约束评测。
8.7 数据筛选规则简单且可能产生选择偏差
45 个关键词采用大小写敏感的直接子串匹配。它可复现、成本低,但可能漏掉不同大小写或同义表达,也可能误删标题碰巧含关键词却视觉自足的视频。后续 VLM 分类能继续过滤,却不能恢复被第一步删除的样本。
8.8 公开资产的可复现性仍有限
当前代码仓库公开了数据构造脚本、提示词和离线回归测试,但 README 明确说明源视频、生成后的数据集、模型权重、服务凭证和运行输出不包含在仓库中。复现者仍需自行获得素材、配置多模态服务并处理 Koala-36M 与第三方组件的许可限制。
8.9 模型比较并非完全统一的推理预算实验
开放模型采用官方默认配置,闭源模型使用产品暴露的默认设置。不同系统在时长、帧率、提示处理、隐含增强和推理预算上可能不同。排行榜反映“默认可用系统”的现实表现,但不等同于严格控制算力、参数量和采样预算后的架构比较。
9. 应用影响与工程启示
9.1 视频生成产品应把“任务完成”列为独立验收维度
虚拟试穿、装修预览、产品演示、食物制作和 DIY 教程不能只验收画质。产品评测至少要分开记录:结果是否出现、参考实体是否保持、连续性是否成立、画面是否可靠。OA 与 GR 的错位表明,用单一美学分数做模型路由会隐藏严重功能失败。
9.2 参考图不是装饰,而是任务状态的语义锚点
I2V 相对 T2V 的巨大 OA 优势说明,参考图承担了身份、材料、结构和场景关系的绑定功能。工程上应保留参考输入的 provenance,并在结果检查中显式核对任务相关属性,而不是只计算全局图像相似度。
9.3 训练目标可以从“还原视频”转向“达到可验证终态”
SemComp-Data 的同源参考—结果对可以用于结果条件训练、偏好优化、奖励建模或 rejection sampling。OA 的四个标准也可转化为分项奖励。但论文只验证了评测,没有实证证明用 SemComp-Data 训练能提升模型,这仍是待验证方向。
9.4 VLM 裁判需要多模型与人工校准
生产系统可借鉴结构化二元问答,而不应直接复制单一裁判配置。更稳健的做法是对高风险样本使用多 VLM 投票、对分歧项人工复核、长期监控标准级偏差,并将视觉证据保留为审计记录。
9.5 “结果中心”适合作为短视频模型的阶段性能力测试
现有模型难以覆盖长程真实操作,先判断终态能否在短片中成立,是比强制复现完整程序更可行的阶段目标。随着模型时长和世界建模能力提升,评测可以逐步加入中间里程碑、因果顺序和动作安全性,形成从终态完成到过程完成的层级体系。
9.6 模型路由应按任务画像,而不是只看总榜
如果场景强调画面稳定和视觉呈现,Seedance 2.0 的高 GR 可能更有价值;如果重点是参考条件下的结果实现,HunyuanVideo-1.5 的 OA 更强;若两者都重要,Wan2.2-I2V-A14B 在本实验中更均衡。实际选型仍需结合自有数据,因为 60 条 SemComp-Core 无法代表所有业务分布。
10. 相关工作与定位
10.1 VBench、VBench++、EvalCrafter
这些综合基准系统评估视频质量、时序、语义对齐和多种感知维度,为模型横向比较建立了基础。SemComp-Bench 并不否定它们,而是补上一项更接近任务验收的变量:参考上下文中的指定结果是否真正实现。
10.2 TC-Bench 与运动、组合性评测
TC-Bench 关注时间组合性,VMBench 等工作关注运动是否符合感知预期。这类基准擅长检查动作和时序结构;SemComp-Bench 则允许省略中间过程,只要求完成状态与参考语义成立。两者分别回答“过程是否按时间结构发生”和“结果是否完成”,不能互相替代。
10.3 VideoPhy-2、Impossible Videos、WorldModelBench、RISE-Video
这些研究把物理常识、世界规律、因果一致性和世界模型能力引入视频评测。SemComp-Bench 的 GR 也包含物理合理性,但它的独特中心是“指令 + 参考图 + 完成状态”的联合关系。一个视频可以物理合理却没有完成任务,也可以终态看似正确却缺乏可信过程。
10.4 主体一致性与可控视频生成基准
个性化 I2V 和 subject-to-video 基准通常强调身份与外观保持。SemComp-Bench 把一致性扩展为任务相关语义:有时必须保留人物身份,有时保留材料或对象构成,有时只需保留场景布局。它允许任务无关属性变化,因此比像素或外观一致性更灵活,也更依赖语义裁判。
10.5 SemComp-Bench 的准确位置
最合理的使用方式不是用 OA/GR 替换所有现有分数,而是建立分层评测:
- 用质量基准检查清晰度、运动和一般时序;
- 用物理与世界模型基准检查规律和因果;
- 用 SemComp-Bench 检查参考约束下的终态任务完成;
- 对安全关键应用另加完整过程、规则遵守和人工验收。
11. 结论
SemComp-Bench 把视频生成评测推进到一个更严格也更实用的问题:模型不是只要生成“像在做事”的画面,而要让给定对象在语义连续的前提下到达指定结果。通过同源参考—结果数据、双指令设计和 OA/GR 双指标,论文清楚展示了当前模型的能力断层:最佳可靠性已超过 90%,最佳任务完成率却仍不到 40%。
这项工作的核心洞见可以概括为三点:
- 画质与任务完成必须分开测。 可靠性高不代表指定结果成立;
- 参考图提供的是语义身份与状态约束。 它对实体一致性和场景连续性的作用远大于简单的视觉提示;
- 结果导向是必要但不充分的评测层。 它适合短视频模型的真实任务验收,却不能替代过程、安全和人工校准。
从研究路线看,下一步最重要的不是继续堆叠单一排行榜,而是扩充核心集、引入多裁判与人工一致性研究、重复生成估计方差,并验证 SemComp-Data 能否真正改善训练。只有当模型既能把视频“做得像”,又能把任务“做得成”,视频生成才开始从视觉合成工具走向可验证的任务执行系统。
参考资料
- Hugging Face Papers, SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation
- Keyu Tu et al., arXiv:2608.17426 摘要页
- Keyu Tu et al., arXiv v1 HTML 全文
- Keyu Tu et al., 论文 PDF
- SemComp-Bench, 官方项目页
- SemComp-Bench, 数据构造代码仓库