摘要
现有多模态推理方法主要遵循两种范式:先将视觉输入转换为文本再推理,或在统一视听表示空间内进行端到端推理。然而,前者因静态转换丢失细粒度细节,后者易受语言主导而削弱对视觉证据的忠实度。本文指出核心挑战在于何时将视觉证据引入推理过程。为此,我们提出 CSMR 框架,由语言模型控制推理流程,自主决定何时调用独立视觉感知模块以获取任务相关的视觉证据。实验表明,CSMR 在零样本设置下于多个基准测试中准确率显著优于基线方法,其优势主要源于所提出的认知调度机制。
AI 推荐理由
论文提出多模态推理新框架,核心解决视觉证据引入时机以提升推理忠实度。
研究机构
Key Laboratory of Multimedia Data Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, 361005, P.R. China
School of Information Engineering, Xiamen University, China
论文信息