Long-horizon Planning Multi-agent Systems Game Benchmark Decision Making
摘要

本文提出 PokeAgent 挑战,这是一个基于宝可梦多智能体战斗系统及大型角色扮演游戏环境的大规模决策基准。针对部分可观测性、博弈推理及长程规划等前沿难题,该基准设立了对战与速通双赛道。前者提供超两千万条战斗轨迹以评估战略推理,后者构建了首个标准化 RPG 速通评估框架。实验表明,通用大模型在长程规划与复杂决策上与专家强化学习及人类顶尖水平存在显著差距,证明了该基准在推动智能体规划研究方面的独特价值。

AI 推荐理由

论文核心关注长程规划与序列决策,特别是在 RPG 速通赛道中明确强调长视野规划能力。

研究机构
Team Heist Team PA-Agent Team FourPlay Team hkkleson Team August NYU Google DeepMind Team Hamburger Team Porygon2AI Team Deepset Princeton UT-Austin
论文信息
作者 Seth Karten, Jake Grigsby, Tersoo Upaa, Junik Bae, Seonghun Hong et al.
发布日期 2026-03-16
arXiv ID 2603.15563
相关性评分 9/10 (高度相关)