Video Reasoning Reinforcement Learning Verifiable Rewards Spatial Reasoning
摘要

视频生成模型虽能产生视觉连贯内容,但在空间推理和多步规划任务上表现不佳。强化学习(RL)可提升泛化能力,但其效果取决于奖励设计。本文通过将组相对策略优化(GRPO)适配于流式视频模型,并在迷宫求解与机器人导航任务中训练,系统研究了该问题。研究发现多模态奖励模型在此场景下严重失效,因此设计了基于客观任务指标的可验证奖励函数。实验表明,采用可验证奖励的 RL 微调显著提升了模型在复杂 3D 迷宫及避障任务中的准确率,确立了可验证奖励设计作为稳健视频推理的关键赋能者。

AI 推荐理由

论文核心研究视频生成模型的空间推理与多步规划能力,通过可验证强化学习显著提升推理性能。

研究机构
Iowa State University, Ames, IA 50011, USA Tulane University, New Orleans, LA 70118, USA Princeton University, Princeton, NJ 08544, USA
论文信息
作者 Ming Liu, Yunbei Zhang, Shilong Liu, Liwen Wang, Wensheng Zhang
发布日期 2026-03-29
arXiv ID 2603.27866
相关性评分 9/10 (高度相关)