AI看图其实是文字游戏

AI看图其实是文字游戏

21分钟 ·
播放数6
·
评论数0

Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning

一句话核心结论

当前多模态大语言模型(MLLMs)不具备真正以视觉为核心的推理能力,在感知、结构、概念三类视觉推理任务上和人类差距巨大,现有推理策略效果有限。

它到底研究了啥

研究场景

视觉中心推理:日常场景中感知与推理深度绑定的任务,要求模型直接基于视觉证据推理,而非依赖语言先验。

测试对象

主流多模态大语言模型(MLLMs)。

怎么测的

  • 构建VisReason 基准:含1505 个问题10 个类别,覆盖感知、结构、概念三大类视觉推理。

  • 对比现有视觉推理基准,测试模型在纯视觉驱动推理上的真实能力。

  • 验证测试时推理策略(如分步思考)的有效性。

测出来啥结果

  • VisReason 是全新挑战,暴露 MLLMs 与人类的巨大差距

  • 各类模型在基准上表现差,现有测试推理策略收益极低

  • 模型推理严重依赖语言,难以从视觉证据中直接推导结论

最后结论

当前 MLLMs 的视觉推理是语言主导的 “伪推理”,无法超越语言、真正扎根视觉证据推理;VisReason 可精准诊断模型的视觉原生推理能力缺陷