顶尖AI难辨视频逻辑破绽

顶尖AI难辨视频逻辑破绽

14分钟 ·
播放数6
·
评论数0

Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos

一句话核心结论

Artifact-Bench专门评估多模态大模型识别 AI 生成视频瑕疵的能力,发现主流模型在这项任务上普遍表现很差,甚至不如随机水平,和人类审美也不一致。

它到底研究了啥

AI 生成视频越来越逼真,但仍存在时间不一致、结构变形、语义混乱等 “瑕疵”。现有评测不系统,尤其缺少对非写实视频的检测。本文提出Artifact-Bench,专门测模型识别这些瑕疵的能力。

研究场景

AI 生成视频的真实性瑕疵检测与评估

测试对象

19 款主流多模态大模型(MLLM)。

怎么做

  1. 建立三层瑕疵分类:覆盖写实、动画、CG 风格视频;

  2. 设计三项任务:真伪分类、真实度对比、细粒度瑕疵识别;

  3. 在多类 AI 视频上做系统性测试。

测出来啥结果

  • 多数模型接近随机甚至更差,瑕疵感知能力弱;

  • 模型判断与人类偏好不一致,难以作为可靠评估者。

最后结论

当前 MLLM 难以可靠识别 AI 视频瑕疵;Artifact-Bench提供了标准评测基准,暴露了模型在真实感判断上的短板。