VLM Agents Self-Improvement Game Benchmark Agentic Reflection
摘要

针对现有视觉语言模型(VLM)游戏基准缺乏统一协议及仅关注单次尝试得分的局限,本文提出 OmniGameArena。该基准包含十二款基于虚幻引擎 5 构建的实时游戏,涵盖单人、对抗及合作模式,并提供统一动作接口。核心创新在于“改进动态曲线”(IDC),这是一种智能体反射机制,利用工具型反射 LLM 在多轮次中自主优化受限技能提示。除冷启动得分外,IDC 还揭示了智能体在反射过程中的得分演化及其在未见任务变体上的泛化表现,全面评估了 VLM 智能体的自我进化能力。

AI 推荐理由

论文核心提出改进动态曲线(IDC),利用反射 LLM 自主优化技能提示,聚焦 Agent 自我进化。

研究机构
The University of Hong Kong LIGHTSPEED The Chinese University of Hong Kong Tsinghua University
论文信息
作者 Mingxian Lin, Shengju Qian, Yuqi Liu, Yi-Hua Huang, Yiyu Wang et al.
发布日期 2026-06-08
arXiv ID 2606.09826
相关性评分 9/10 (高度相关)