摘要
本文指出大语言模型在静态基准表现优异,但在对抗性、时间敏感环境中的交互能力尚不明确。为此,作者提出了战略战术代理推理(STAR)基准,这是一个多智能体评估框架,通过一对一零和竞争互动,将推理视为迭代自适应的决策过程。STAR 支持回合制与实时设置,旨在分析长程战略规划与快节奏战术执行。研究揭示了显著的“策略 - 执行差距”:强推理模型在回合制中占优,但因延迟在实时场景中表现不佳,表明战略智能不仅依赖推理深度,更取决于将计划转化为及时行动的能力。
AI 推荐理由
论文核心评估 LLM 在对抗环境中的战略推理与决策能力,提出新基准。
研究机构
清华大学 (Tsinghua University) 中国 (China)
论文信息