摘要
视频推理要求模型在帧间定位并追踪相关证据。针对现有强化学习方法在时空定位上的不足及高昂的数据或计算成本,本文提出 VisionCoach。这是一种输入自适应的强化学习框架,利用视觉提示作为训练引导,选择性增强挑战性输入的相关证据并抑制干扰。模型通过自蒸馏内化该能力,实现无需外部提示的直接推理。实验表明,该方法在多个基准测试中达到最先进水平,且保持高效单一的推理路径。
AI 推荐理由
论文核心解决视频推理中的时空定位难题,通过强化学习提升 grounded reasoning 能力。
研究机构
北卡罗来纳大学教堂山分校
论文信息