Video Reasoning Test-Time Optimization VLM VGM Adaptive Learning
摘要

针对现有视频生成模型(VGM)在视频推理任务中难以理解规则导致逻辑失败的问题,本文提出将视觉语言模型(VLM)从“求解者”转变为“教师”的新范式。该方法利用 VLM 强大的感知能力提取任务规则并构建可微奖励,通过测试时在线优化轻量级 LoRA 模块来指导 VGM 推理器。实验表明,该方法在符号及通用视频推理基准上平均性能提升 16.7 分,显著优于现有范式,证明了集成 VLM 作为测试时教师是实现泛化视频推理的有效途径。

AI 推荐理由

论文核心解决视频推理中的逻辑失败问题,提出新范式显著提升推理能力。

研究机构
City University of Hong Kong Kuaishou Technology
论文信息
作者 Junhao Cheng, Liang Hou, Tianxiong Zhong, Xin Tao, Pengfei Wan et al.
发布日期 2026-06-01
arXiv ID 2606.02564
相关性评分 9/10 (高度相关)