LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models
一句话核心结论
LENS是分层多模态推理基准,测出当前顶尖 MLLM 的复杂推理能力很弱,推理任务准确率都不到 60%。
它到底研究了啥
现有评测任务分散,没法看从感知到高阶推理的递进能力;本文做了LENS,系统性评估这条能力链。
研究场景
多模态大模型从感知→理解→推理的分层能力测评。
测试对象
15 + 顶尖 MLLM,含 Qwen2.5‑VL、InternVL3、GPT‑4o、QVQ、Kimi‑VL。
怎么做
收集 3.4K 现代图、60K + 人工题,覆盖 8 任务、12 日常场景;
分层:感知、理解、推理;
每张图统一标注,支持跨任务一致性测评。
测出来啥结果
所有模型推理任务准确率<60%,感知到推理存在明显能力断层。
最后结论
顶尖 MLL 离现实复杂推理还差很远;LENS是标准基准,能暴露短板、指导优化。
