摘要
多模态大语言模型在单视频理解表现优异,但在多视频推理上仍受限。现有方法常将多视频拼接输入,导致训练推理不匹配及信息丢失,且缺乏显式跨视频协调。针对此问题,本文提出 MVX-Bench 基准,涵盖 1442 个问题与 4255 个视频,重构了 11 类经典视觉任务。同时提出 SAMA 框架,通过集成视觉工具、特定任务技能及冲突感知验证机制,实现迭代结构化推理。实验表明,SAMA 在 MVX-Bench 上优于开源基线与 GPT,消融实验验证了技能设计与冲突解决的有效性。
AI 推荐理由
论文提出技能增强框架,核心在于整合视觉工具与特定技能进行推理。
研究机构
德克萨斯大学达拉斯分校
论文信息