LLM Evaluation Negotiation Economic Reasoning Agent Diagnosis
摘要

谈判是经济交换的核心机制,也是测试代理语言模型的关键场景,但其评估因缺乏内在验证器而极具挑战。现有研究多依赖聚合结果(如成交率),导致失败原因不透明。本文提出 TERMS-Bench,一种基于贝叶斯博弈的框架,通过将对手设定为具有潜在类型和策略的诊断工具,使环境本身成为验证器。该框架实现了可归因的失败分析及最优性差距度量。实验表明,前沿模型虽在成交率上饱和,但在盈余提取、线索利用及信念校准等推理维度上存在显著差异。

AI 推荐理由

论文聚焦谈判中的经济推理与策略诊断,核心在于评估和优化代理的推理能力。

研究机构
Stanford School of Engineering Stanford Department of Economics Stanford Graduate School of Business
论文信息
作者 Erica Zhang, Fangzhao Zhang, Aneesh Pappu, Batu El, Jose Blanchet et al.
发布日期 2026-05-13
arXiv ID 2605.13909
相关性评分 8/10 (高度相关)