摘要
大型语言模型(LLM)智能体常在用户指令不明确时运行,潜在的意图不确定性会导致错误的工具操作。为此,本文提出一种目标导向的澄清框架,使澄清行为与歧义消除保持一致。核心方法是“信息增益奖励”,该指标通过衡量澄清交互引发的贝叶斯信念更新来量化澄清问题的效用。利用该奖励训练澄清器(LLM),以优化高信息增益,确保澄清有效降低不确定性并提升任务完成率。在增强型τ-Bench 环境中的实验表明,该方法相比无澄清基线将成功率提高了 3.7%,且平均仅增加 0.3 个交互步骤。
AI 推荐理由
提出目标导向澄清框架,通过信息增益优化任务规划中的不确定性消除,直接提升任务完成率。
研究机构
Information Hub, HKUST(GZ)
Jilin University
HKUST
Correspondence to: Wei Wang , Zhiyang Guo , Mengyi Deng
Zhiyang Guo , Mengyi Deng
论文信息