Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning
一句话核心结论
当前多模态大语言模型(MLLMs)不具备真正以视觉为核心的推理能力,在感知、结构、概念三类视觉推理任务上和人类差距巨大,现有推理策略效果有限。
它到底研究了啥
研究场景
视觉中心推理:日常场景中感知与推理深度绑定的任务,要求模型直接基于视觉证据推理,而非依赖语言先验。
测试对象
主流多模态大语言模型(MLLMs)。
怎么测的
构建VisReason 基准:含1505 个问题、10 个类别,覆盖感知、结构、概念三大类视觉推理。
对比现有视觉推理基准,测试模型在纯视觉驱动推理上的真实能力。
验证测试时推理策略(如分步思考)的有效性。
测出来啥结果
VisReason 是全新挑战,暴露 MLLMs 与人类的巨大差距。
各类模型在基准上表现差,现有测试推理策略收益极低。
模型推理严重依赖语言,难以从视觉证据中直接推导结论。
最后结论
当前 MLLMs 的视觉推理是语言主导的 “伪推理”,无法超越语言、真正扎根视觉证据推理;VisReason 可精准诊断模型的视觉原生推理能力缺陷。
