摘要
谈判是经济交换的核心机制,也是测试代理语言模型的关键场景,但其评估因缺乏内在验证器而极具挑战。现有研究多依赖聚合结果(如成交率),导致失败原因不透明。本文提出 TERMS-Bench,一种基于贝叶斯博弈的框架,通过将对手设定为具有潜在类型和策略的诊断工具,使环境本身成为验证器。该框架实现了可归因的失败分析及最优性差距度量。实验表明,前沿模型虽在成交率上饱和,但在盈余提取、线索利用及信念校准等推理维度上存在显著差异。
AI 推荐理由
论文聚焦谈判中的经济推理与策略诊断,核心在于评估和优化代理的推理能力。
研究机构
Stanford School of Engineering
Stanford Department of Economics
Stanford Graduate School of Business
论文信息