Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos
一句话核心结论
Artifact-Bench专门评估多模态大模型识别 AI 生成视频瑕疵的能力,发现主流模型在这项任务上普遍表现很差,甚至不如随机水平,和人类审美也不一致。
它到底研究了啥
AI 生成视频越来越逼真,但仍存在时间不一致、结构变形、语义混乱等 “瑕疵”。现有评测不系统,尤其缺少对非写实视频的检测。本文提出Artifact-Bench,专门测模型识别这些瑕疵的能力。
研究场景
AI 生成视频的真实性瑕疵检测与评估。
测试对象
19 款主流多模态大模型(MLLM)。
怎么做
建立三层瑕疵分类:覆盖写实、动画、CG 风格视频;
设计三项任务:真伪分类、真实度对比、细粒度瑕疵识别;
在多类 AI 视频上做系统性测试。
测出来啥结果
多数模型接近随机甚至更差,瑕疵感知能力弱;
模型判断与人类偏好不一致,难以作为可靠评估者。
最后结论
当前 MLLM 难以可靠识别 AI 视频瑕疵;Artifact-Bench提供了标准评测基准,暴露了模型在真实感判断上的短板。
