摘要
视频问答(VideoQA)要求模型联合推理空间、时间及语言线索。当前大型多模态模型通常隐式执行复杂的多步推理,导致决策过程不透明。相比之下,大型推理模型能生成明确的中间逻辑步骤,增强可解释性并提升多跳推理准确率,但缺乏原生视频理解能力。本文提出 UpstreamQA,一种模块化框架,利用多模态大型推理模型进行物体识别和场景上下文生成,将丰富的推理轨迹传递给下游多模态模型以完成问答。实验表明,引入显式推理能显著提升性能与可解释性,但在基线性能较高时可能导致退化。该框架为结合显式推理与多模态理解提供了原则性方法。
AI 推荐理由
论文核心提出显式推理框架,通过解耦视频推理组件提升多步推理能力与可解释性。
研究机构
Lincoln North Star High School
The Charter School of Wilmington
Greenwich High School
Santa Susana High School
论文信息