摘要
大语言模型日益作为经济代理部署于市场与拍卖中,其行为难以预测。现有基准基于固定博弈,易饱和且难泛化至真实复杂环境。本文提出 GENSTRAT,利用程序生成的两人零和不完全信息卡牌游戏分布,实现可持续评估并抗污染。结合六维能力剖面方法论及“锯齿度”指标,检测模型在相似策略游戏中的表现波动。通过对九种前沿模型进行超 3.6 万场对决评估,发现整体实力相近的模型在能力剖面与局部稳定性上存在显著差异,为实际部署提供关键诊断。
AI 推荐理由
论文核心研究 LLM 在战略环境中的推理能力,提出新基准与评估方法。
研究机构
普林斯顿大学
谷歌
论文信息