摘要
针对代理大模型强化学习中稀疏奖励导致难以评估多轮交互中单次工具调用贡献的问题,本文提出 A$^2$TGPO 方法。该方法利用信息增益作为内在过程信号,并通过三项创新改进其应用:轮次组归一化以消除位置上下文差异;方差重缩放折扣累积以保持优势幅度稳定;自适应轮次级裁剪以根据信息量动态调整更新范围。实验表明,该机制有效提升了工具使用策略的学习效率与稳定性。
AI 推荐理由
论文核心解决多轮交互中工具调用的信用分配问题,直接优化 Agent 技能学习。
研究机构
Tencent Inc
The Chinese University of Hong Kong
Shenzhen MSU-BIT University
论文信息