摘要
代理强化学习虽能训练具备外部工具使用能力的 LLM 代理,但易导致冗余工具调用并模糊模型固有知识边界。现有奖励塑造方法目标粗糙,易引发奖励欺骗。本文提出 AKBE 方法,通过在训练中执行双路径(有无工具) rollout 动态探测知识边界,定义实例级的工具需求判定及最小调用次数。通过对比路径正确性,AKBE 构建针对性监督信号指导高效工具使用模式。实验表明,该方法在七个 QA 基准上平均准确率提升 1.85,工具调用减少 18%,显著提高了工具生产力且无精度效率权衡。
AI 推荐理由
论文核心解决 Agent 工具调用的冗余与边界模糊问题,提出动态探测机制优化技能使用效率。
研究机构
Tencent Inc
The Chinese University of Hong Kong
Shenzhen MSU-BIT University
论文信息