摘要
针对现有强化学习在领域特定代理中因奖励粗糙导致工具调用对齐困难的问题,本文提出 ToolRLA。该方法包含三阶段后训练流程,核心是细粒度奖励函数,从格式有效性、工具选择正确性、调用效率及合规性四个维度评估工具调用。在真实金融顾问场景部署显示,该法显著提升任务完成率至 91%,大幅降低工具错误与违规率,并验证了细粒度分解相较于粗粒度奖励的优势及泛化能力。
AI 推荐理由
论文核心在于通过细粒度奖励分解优化 Agent 的工具选择、调用格式及效率,直接提升技能学习能力。
研究机构
Unaffiliated
论文信息