顶尖AI看图推理集体翻车

顶尖AI看图推理集体翻车

13分钟 ·
播放数12
·
评论数0

LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models

一句话核心结论

LENS是分层多模态推理基准,测出当前顶尖 MLLM 的复杂推理能力很弱,推理任务准确率都不到 60%。

它到底研究了啥

现有评测任务分散,没法看从感知到高阶推理的递进能力;本文做了LENS,系统性评估这条能力链。

研究场景

多模态大模型从感知→理解→推理的分层能力测评。

测试对象

15 + 顶尖 MLLM,含 Qwen2.5‑VL、InternVL3、GPT‑4o、QVQ、Kimi‑VL。

怎么做

  1. 收集 3.4K 现代图、60K + 人工题,覆盖 8 任务、12 日常场景;

  2. 分层:感知、理解、推理;

  3. 每张图统一标注,支持跨任务一致性测评。

测出来啥结果

所有模型推理任务准确率<60%,感知到推理存在明显能力断层。

最后结论

顶尖 MLL 离现实复杂推理还差很远;LENS是标准基准,能暴露短板、指导优化。