摘要
本文提出 PokeAgent 挑战,这是一个基于宝可梦多智能体战斗系统及大型角色扮演游戏环境的大规模决策基准。针对部分可观测性、博弈推理及长程规划等前沿难题,该基准设立了对战与速通双赛道。前者提供超两千万条战斗轨迹以评估战略推理,后者构建了首个标准化 RPG 速通评估框架。实验表明,通用大模型在长程规划与复杂决策上与专家强化学习及人类顶尖水平存在显著差距,证明了该基准在推动智能体规划研究方面的独特价值。
AI 推荐理由
论文核心关注长程规划与序列决策,特别是在 RPG 速通赛道中明确强调长视野规划能力。
研究机构
Team Heist
Team PA-Agent
Team FourPlay
Team hkkleson
Team August
NYU
Google DeepMind
Team Hamburger
Team Porygon2AI
Team Deepset
Princeton
UT-Austin
论文信息