Reinforcement Learning Long-horizon Planning Vision-Language Models Game Agents
摘要

针对视觉语言模型(VLM)在长程交互决策中的局限,本文提出 Odysseus 框架,利用强化学习在《超级马里奥乐园》中实现超 100 回合的协同感知、推理与行动。研究设计了适配的 PPO 变体及轻量级回合批评家,显著提升训练稳定性与样本效率。实验表明,预训练 VLM 提供的动作先验优于从头训练的深强化学习,模型在游戏内及跨游戏泛化中表现卓越,平均进度提升至少三倍,同时保持通用领域能力,为具身智能体的长程规划提供了关键指导。

AI 推荐理由

论文核心解决长程决策(100+ 回合)中的任务规划与多步协调问题,通过 RL 提升长视野规划能力。

研究机构
Princeton Language and Intelligence, Princeton University Fudan University Tsinghua University
论文信息
作者 Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang et al.
发布日期 2026-05-01
arXiv ID 2605.00347
相关性评分 9/10 (高度相关)