摘要
针对现有视频生成模型(VGM)在视频推理任务中难以理解规则导致逻辑失败的问题,本文提出将视觉语言模型(VLM)从“求解者”转变为“教师”的新范式。该方法利用 VLM 强大的感知能力提取任务规则并构建可微奖励,通过测试时在线优化轻量级 LoRA 模块来指导 VGM 推理器。实验表明,该方法在符号及通用视频推理基准上平均性能提升 16.7 分,显著优于现有范式,证明了集成 VLM 作为测试时教师是实现泛化视频推理的有效途径。
AI 推荐理由
论文核心解决视频推理中的逻辑失败问题,提出新范式显著提升推理能力。
研究机构
City University of Hong Kong
Kuaishou Technology
论文信息