摘要
本文提出 LudoBench,一个用于评估大语言模型在飞行棋(一种随机多智能体棋盘游戏)中战略推理能力的基准。该基准包含 480 个手工设计的场景,涵盖 12 类不同的决策类别,旨在隔离特定的战略选择。研究构建了一个支持多种代理类型的四人飞行棋模拟器,并以博弈论代理作为战略上限基准。实验发现,现有模型与博弈论基准的一致性仅为 40%-46%,且表现出“终结者”或“建设者”等行为原型缺陷。此外,模型在相同状态下因历史语境 framing 不同而表现出行为偏移,揭示了其对提示词的敏感性。
AI 推荐理由
论文核心评估 LLM 在随机博弈中的战略规划、多步决策及目标导向行为,属规划能力研究。
研究机构
计算机科学与信息系统学院,比斯皮拉尼理工学院
论文信息