VideoQA Explicit Reasoning Multimodal LLM Interpretability
摘要

视频问答(VideoQA)要求模型联合推理空间、时间及语言线索。当前大型多模态模型通常隐式执行复杂的多步推理,导致决策过程不透明。相比之下,大型推理模型能生成明确的中间逻辑步骤,增强可解释性并提升多跳推理准确率,但缺乏原生视频理解能力。本文提出 UpstreamQA,一种模块化框架,利用多模态大型推理模型进行物体识别和场景上下文生成,将丰富的推理轨迹传递给下游多模态模型以完成问答。实验表明,引入显式推理能显著提升性能与可解释性,但在基线性能较高时可能导致退化。该框架为结合显式推理与多模态理解提供了原则性方法。

AI 推荐理由

论文核心提出显式推理框架,通过解耦视频推理组件提升多步推理能力与可解释性。

研究机构
Lincoln North Star High School The Charter School of Wilmington Greenwich High School Santa Susana High School
论文信息
作者 Jason Nguyen, Ameet Rao, Alexander Chang, Ishaan Kumar, Erin Tan
发布日期 2026-04-25
arXiv ID 2604.23145
相关性评分 9/10 (高度相关)