摘要
大型语言模型在多种推理基准上表现优异,但这些评估通常关注孤立任务,与面向任务的对话(TOD)中的实际应用存在差异。在 TOD 场景中,模型需在生成文本的同时进行推理,并遵循角色、格式和风格指令。本文提出 BOULDER,一个涵盖八类旅行相关任务的动态基准,涉及算术、空间和时间推理。通过对比孤立与对话变体,实验发现两者间存在显著且一致的性能差距。消融实验表明,该差距主要由多轮对话性质驱动,角色设定和工具使用要求亦有影响。结果强调需在真实交互场景中评估 LLM 推理能力。
AI 推荐理由
论文核心研究对话场景对 LLM 推理能力的影响,构建基准并量化性能差距。
研究机构
查理大学数学与物理学院
形式与应用语言学研究所
论文信息