摘要
现有大规模多模态语言模型在长视频理解中常因文本与视觉令牌失衡而产生幻觉。针对此问题,本文提出 VideoTIR,利用强化学习鼓励模型正确使用多层次工具包,以高效检索并聚焦关键视频片段。该方法结合了零样本强化学习与监督微调冷启动,并提出了工具包动作分组策略优化(TAGPO)以减少冗余调用。此外,还开发了基于沙箱的轨迹合成框架以生成高质量数据。实验表明,该方法在多个长视频问答基准上显著提升了理解的准确性与效率。
AI 推荐理由
论文核心提出工具集成推理框架,利用 RL 优化长视频理解中的推理过程。
研究机构
南京大学
南开大学
华东师范大学
新加坡国立大学
论文信息