DLWM: Diverse Latent World Models for Efficient Multimodal Reasoning
一句话核心结论
现有多模态大模型推理仅单一路径推演、算力开销大,本文提出 DLWM 多样化隐空间世界模型,通过多假设并行推理 + 资源自适应强化学习,推理精度提升 2-5 个点,内存占用降低 24%。
它到底研究了啥
研究场景
多模态多步推理任务:图像存在遮挡、模糊、视角变化、语义歧义等干扰,存在多种合理解释的复杂视觉推理场景。
现有方法痛点
仅采用单一隐式解读,推理沿固定路径展开,无法探索多类合理假设;
统一固定算力分配策略,内存占用高、推演计算成本大。
核心方案 DLWM 两大模块
多样化隐世界假设构建:在连续隐空间生成多组独立视觉解读假设,搭配正交多样性正则器,避免假设趋同坍塌,每条假设独立开展隐空间推理;
资源约束强化学习策略:将推理建模为序列决策问题,自适应分配算力,动态选择拓展、终止、合并推理分支,压缩内存、提升推演效率。
怎么测的
在多个主流多模态推理基准数据集上完成对比实验。
测出来啥结果
对比现有主流推理方案,任务准确率提升 2-5 个百分点;
模型内存使用量降低 24%;
正交正则有效保证多假设多样性,资源自适应策略大幅削减冗余计算开销。
最后结论
针对视觉歧义场景,单一固定路径推理存在明显缺陷;DLWM 通过多假设并行隐推理 + 动态算力调度,兼顾多假设探索能力与计算效率,是高效多模态推理可行框架。
