Sales Agent Benchmark Skill Evaluation Dialogue System
摘要

销售对话需要在不对称激励下进行多轮目标导向的说服,这对大语言模型极具挑战。现有基准鲜少衡量交易进展与结果。本文提出 SalesLLM,一个源自金融与消费品真实应用的双语基准,包含可控难度与人设的多轮场景。我们设计了全自动评估流程,结合基于 LLM 的销售进程评分器与微调 BERT 购买意图分类器。此外,训练用户模型 CustomerLM 以提升仿真 fidelity,显著降低角色反转率。实验表明该基准与专家评分高度相关,能有效评估面向结果的智能体销售技能。

AI 推荐理由

论文核心构建销售技能基准,评估 LLM 在特定领域技能上的表现与进展。

研究机构
Wenhao Hu Yanqi Yang Xuanbo Su, Wenhao Hu, Le Zhan, Yanqi Yang, Leo Huang
论文信息
作者 Xuanbo Su, Wenhao Hu, Le Zhan, Yanqi Yang, Leo Huang
发布日期 2026-04-08
arXiv ID 2604.07054
相关性评分 9/10 (高度相关)