V2V-Bench量化AI视频编辑好坏

V2V-Bench量化AI视频编辑好坏

17分钟 ·
播放数9
·
评论数0

论文:V2V-Bench: A Comprehensive Benchmark for Video-to-Video Generation Evaluation

一句话核心结论

现有图文、文生视频评价指标无法适配视频转视频任务,本文提出全新多维评测基准 V2V-Bench,可精准评估视频转视频模型效果,评测结果也展现出主流模型各有优劣。

它到底研究了啥

研究场景

视频转视频(V2V)生成效果评测:该任务要求模型既遵循编辑指令,又保留原视频帧间对应关系,传统评测指标存在明显短板。

测试对象

两款商用模型 Grok Imagine、Gemini Veo3,一款开源模型 Open Sora 2。

怎么测的

构建包含11 个维度、五大类别的 V2V-Bench 评测体系,涵盖时间对齐、结构保真度、转换质量、视频画质、语义对齐;搭配多样原视频与高难度编辑任务开展测试,并将评测结果和人工打分做相关性校验。

测出来啥结果

  1. 各模型优势互补:Grok Imagine 编辑保真度更优,Gemini Veo3 视觉画质更强。

  2. 在 6 项视频转视频专属维度上,该基准与人工评判的斯皮尔曼相关系数达 0.905,评测结果可信度高。

最后结论

V2V-Bench 可有效填补视频转视频领域专业评测工具的空白,能客观衡量不同模型的实际表现。