摘要
视频生成模型虽能产生视觉连贯内容,但在空间推理和多步规划任务上表现不佳。强化学习(RL)可提升泛化能力,但其效果取决于奖励设计。本文通过将组相对策略优化(GRPO)适配于流式视频模型,并在迷宫求解与机器人导航任务中训练,系统研究了该问题。研究发现多模态奖励模型在此场景下严重失效,因此设计了基于客观任务指标的可验证奖励函数。实验表明,采用可验证奖励的 RL 微调显著提升了模型在复杂 3D 迷宫及避障任务中的准确率,确立了可验证奖励设计作为稳健视频推理的关键赋能者。
AI 推荐理由
论文核心研究视频生成模型的空间推理与多步规划能力,通过可验证强化学习显著提升推理性能。
研究机构
Iowa State University, Ames, IA 50011, USA
Tulane University, New Orleans, LA 70118, USA
Princeton University, Princeton, NJ 08544, USA
论文信息