Video Reasoning VLM-VGM Collaboration Chain-of-Frames Closed-loop Framework
摘要

近期“视频思维”方法利用视频生成模型(VGM)生成连贯帧链进行视觉推理,但在长程任务中易出现漂移和误差累积。本文提出 CollabVR,一种闭环协作框架,在步骤粒度上耦合视觉语言模型(VLM)与 VGM。VLM 规划即时动作、检查生成片段,并将诊断结果融入下一步提示以修复失败。实验表明,该方法在多个基准上显著优于单一推理及测试时扩展基线,且与推理微调正交可叠加,有效提升了复杂任务的推理能力。

AI 推荐理由

论文提出闭环协作框架,利用 VLM 进行逐步视觉推理与验证,核心解决视频生成中的推理漂移问题。

研究机构
KAIST Kyung Hee University AITRICS
论文信息
作者 Joowon Kim, Seungho Shin, Joonhyung Park, Eunho Yang
发布日期 2026-05-09
arXiv ID 2605.08735
相关性评分 9/10 (高度相关)