摘要
基于大语言模型的智能体常做出次优工具使用决策,包括不支持的工具调用和幻觉直接响应,导致多步交互中错误累积。现有方法主要通过推理时修正或基于结果的粗粒度奖励信号来改善,却未充分探索决策的不确定性特征。本文发现面向决策的强化学习倾向于削弱正确与错误动作间的不确定性分离,导致过度自信的錯誤。为此,我们提出 TRUST 方法,将不确定性量化纳入奖励设计以维持分离,并标注轻量级关键回合注释用于多轮轨迹的统一后训练。实验表明,该方法显著提升了决策质量、智能体性能及不确定性估计的可靠性。
AI 推荐理由
论文核心解决 Agent 工具调用决策次优问题,通过强化学习优化技能使用。
研究机构
上海交通大学, 中国
上海人工智能实验室, 中国
论文信息