摘要
大多数大语言模型基准仅评估对显式请求的响应,忽略了识别并响应用户隐含需求的“对话主动性”。本文提出 ProactBench,将其分解为三种类型:涌现型(单锚点推断)、关键型(多锚点综合)及恢复型(任务完成后的前瞻性价值)。通过构建包含规划者、用户代理和助手模型的三方交互框架,利用信息不对称消除评分偏差。基于 198 个精心策划的对话和 624 个触发点的评测显示,恢复型主动性难以被现有基准预测,提供了新的评估信号。
AI 推荐理由
论文核心评估隐含需求推断与综合推理能力,属高级推理范畴。
研究机构
Boson AI
Toronto, ON, Canada
Santa Clara, CA, USA
论文信息