Agent Evaluation Strategic Planning Game Theory Dynamic Environment
摘要

静态基准无法全面反映大模型在实际系统中的表现。本研究在限时多阶段“风险”博弈环境中,通过重复规划与执行循环评估模型性能。实验显示,Gemini-3.1 在对抗中显著胜出。通过将规划与执行分离,研究发现性能差异主要源于端到端系统行为而非单纯规划能力。进一步分析表明,优胜模型更擅长追踪终极目标并将回合转化为深度征服链。结果支持将 LLM 视为受限工作流中的组件进行评估。

AI 推荐理由

论文核心在于分离并评估 LLM 在动态博弈中的规划与执行能力,重点分析任务规划机制。

论文信息
作者 H. C. Ekne
发布日期 2026-05-21
arXiv ID 2605.22238
相关性评分 9/10 (高度相关)