Reinforcement Learning VLM Agents GRPO Open-World Tasks Self-Evolution
摘要

近期,视觉语言模型(VLM)智能体在开放世界任务中展现出进展,但现有方法主要依赖专家演示的监督微调。由于标准组相对策略优化(GRPO)需完整轨迹导致上下文过长及噪声问题,其在多轮强化学习中应用受限。本文提出 GROW 框架,将轨迹分解为状态 - 动作样本并计算样本间优势,而非视完整轨迹为单一实体。理论分析表明该方法在简化假设下保留了 GRPO 的核心优化信号。在 800 多个 Minecraft 任务上的实验显示,该方法达到了最先进水平。

AI 推荐理由

提出基于 GRPO 的 RL 框架,通过自我优化策略提升 Agent 在开放世界任务中的表现,属自我进化核心研究。

研究机构
上海交通大学 上海人工智能实验室 华东师范大学 山东Normal University
论文信息
作者 Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang et al.
发布日期 2026-05-18
arXiv ID 2605.20246
相关性评分 9/10 (高度相关)