Reinforcement Learning Tool Use Agent Optimization Entropy Guidance
摘要

智能体强化学习虽赋予大模型工具使用能力,但常因过度依赖或保守使用导致训练不稳定。为此,本文提出 TAO-RL 框架,结合工具感知的轨迹过滤与熵引导探索。在数据层面,过滤掉工具执行全失败或缺乏区分度的轨迹,构建高质量训练分布;在算法层面,引入工具感知熵引导奖励,重塑优势函数,鼓励关键决策点的多样化探索。实验表明,该方法在多个推理基准上显著优于现有方法。

AI 推荐理由

论文核心解决 Agent 工具使用中的训练不稳定问题,提出工具感知优化框架。

研究机构
中国科学院自动化研究所
论文信息
作者 Hongye Cao, Nuo Yan, Haoyuan Deng, Ziwei Wang, Tianpei Yang et al.
发布日期 2026-06-02
arXiv ID 2606.03762
相关性评分 9/10 (高度相关)