摘要
静态基准无法全面反映大模型在实际系统中的表现。本研究在限时多阶段“风险”博弈环境中,通过重复规划与执行循环评估模型性能。实验显示,Gemini-3.1 在对抗中显著胜出。通过将规划与执行分离,研究发现性能差异主要源于端到端系统行为而非单纯规划能力。进一步分析表明,优胜模型更擅长追踪终极目标并将回合转化为深度征服链。结果支持将 LLM 视为受限工作流中的组件进行评估。
AI 推荐理由
论文核心在于分离并评估 LLM 在动态博弈中的规划与执行能力,重点分析任务规划机制。
论文信息