Multimodal LLM Efficient Reasoning Adaptive Resolution Visual Token Compression
摘要

多模态大语言模型(MLLMs)虽能通过提升输入保真度增强视觉理解,但由此引发的视觉令牌激增使得同时维持高空间分辨率和长时序上下文变得不可行。本文提出 ResAdapt,一种输入端自适应框架,旨在编码前学习每帧应分配的视觉预算。该方法将分配问题建模为上下文多臂老虎机,并利用成本感知策略优化(CAPO)训练轻量级分配器。实验表明,ResAdapt 在视频问答、时序定位及图像推理任务中显著提升了低预算下的表现,尤其在强压缩下的推理密集型基准测试中增益明显,实现了效率与精度的最佳平衡。

AI 推荐理由

论文核心解决多模态推理中的效率瓶颈,通过自适应分辨率显著提升推理性能。

研究机构
Institute of Automation, Chinese Academy of Sciences University of Chinese Academy of Sciences
论文信息
作者 Huanxuan Liao, Zhongtao Jiang, Yupu Hao, Yuqiao Tan, Shizhu He et al.
发布日期 2026-03-30
arXiv ID 2603.28610
相关性评分 9/10 (高度相关)