摘要
多模态大语言模型在视频时间定位任务中虽取得进展,但常生成浅层推理,难以指导精确定位。针对随机探索低效及奖励函数忽视推理质量的问题,本文提出 TaRO 框架。首先,引入建设性推理探索,利用预生成密集描述构建基于视觉线索和时间戳的推理路径;其次,设计时间敏感性奖励,通过事件边界扰动导致的逻辑概率下降来评估推理质量。最后,采用渐进式课程学习,从奖励引导选择过渡到自主自由探索。实验表明,TaRO 在基准测试中达到了最先进水平。
AI 推荐理由
论文核心提出时间感知推理优化框架,旨在解决多模态模型推理浅层问题,显著提升推理质量。
研究机构
Wangyuan Institute of Computer Technology, Peking University
论文信息