Tool Use Reinforcement Learning Agent Optimization
摘要

代理强化学习常引发工具滥用,即模型对可内部推理解决的问题过度调用外部工具。现有方法通过统一惩罚或硬性限制抑制工具频率,但可能阻碍有益的探索。本文提出高效代理策略优化框架(EAPO),旨在学习选择性工具使用。该框架在每次 rollout 中引入无工具轨迹,应用难度感知的奖励重塑以主要惩罚简单查询中的冗余调用,并利用置信度感知的 token 重加权优化策略学习。实验表明,EAPO 在多个基准上显著提升了准确率与效率的平衡,大幅减少工具调用同时保持推理能力。

AI 推荐理由

论文核心研究 Agent 何时调用工具的技能选择机制,提出优化框架以减少滥用。

研究机构
NLPR, Institute of Automation, Chinese Academy of Sciences ByteDance Zhejiang University
论文信息
作者 Liuji Chen, Dianxing Tang, Xing Shi, Dingshuo Chen, Qiang Liu et al.
发布日期 2026-06-01
arXiv ID 2606.02132
相关性评分 9/10 (高度相关)