Conversational AI Implicit Reasoning Benchmark Agent Evaluation
摘要

大多数大语言模型基准仅评估对显式请求的响应,忽略了识别并响应用户隐含需求的“对话主动性”。本文提出 ProactBench,将其分解为三种类型:涌现型(单锚点推断)、关键型(多锚点综合)及恢复型(任务完成后的前瞻性价值)。通过构建包含规划者、用户代理和助手模型的三方交互框架,利用信息不对称消除评分偏差。基于 198 个精心策划的对话和 624 个触发点的评测显示,恢复型主动性难以被现有基准预测,提供了新的评估信号。

AI 推荐理由

论文核心评估隐含需求推断与综合推理能力,属高级推理范畴。

研究机构
Boson AI Toronto, ON, Canada Santa Clara, CA, USA
论文信息
作者 Sepehr Harfi, Ahmad Salimi, Dongming Shen, Alex Smola
发布日期 2026-05-09
arXiv ID 2605.09228
相关性评分 8/10 (高度相关)