摘要
代理强化学习常引发工具滥用,即模型对可内部推理解决的问题过度调用外部工具。现有方法通过统一惩罚或硬性限制抑制工具频率,但可能阻碍有益的探索。本文提出高效代理策略优化框架(EAPO),旨在学习选择性工具使用。该框架在每次 rollout 中引入无工具轨迹,应用难度感知的奖励重塑以主要惩罚简单查询中的冗余调用,并利用置信度感知的 token 重加权优化策略学习。实验表明,EAPO 在多个基准上显著提升了准确率与效率的平衡,大幅减少工具调用同时保持推理能力。
AI 推荐理由
论文核心研究 Agent 何时调用工具的技能选择机制,提出优化框架以减少滥用。
研究机构
NLPR, Institute of Automation, Chinese Academy of Sciences
ByteDance
Zhejiang University
论文信息