Reinforcement Learning Tool Calling Multi-Turn Dialogue Reward Calibration
摘要

针对多轮任务中工具调用代理面临的稀疏奖励与信用分配难题,本文首次结合 MT-GRPO 与 GTPO 算法,利用基于 LLM 的用户模拟器进行训练。研究发现 naive 设计的稠密奖励会导致性能下降,因此提出“迭代奖励校准”方法,通过实证分析优化每轮奖励设计,并引入混合优势公式消除对齐问题。在 Tau-Bench 基准测试中,该方法显著提升了不同规模模型的性能,小模型甚至超越 GPT-4 系列,实现了该基准上首个公开的强化学习训练成果。

AI 推荐理由

论文核心研究工具调用代理的强化学习训练,直接提升技能学习与执行能力。

研究机构
Amity Research and Application Center (ARAC)
论文信息
作者 Wachiravit Modecrua, Krittanon Kaewtawee, Krittin Pachtrachai, Touchapon Kraisingkorn
发布日期 2026-04-03
arXiv ID 2604.02869
相关性评分 9/10 (高度相关)