Tool-Integrated Reasoning Reinforcement Learning Agent Training Data Efficiency
摘要

针对大语言模型在工具集成推理(TIR)中现有训练范式的局限,如零样本强化学习探索效率低及监督微调后强化学习的数据成本高与能力瓶颈,本文提出 E3-TIR 早期训练预热范式。该方法动态整合专家前缀、专家引导与自我探索三种经验类型,通过在专家“锚点”周围执行多样化分支探索并采用混合策略优化机制,有效缓解分布偏移与前缀共享引发的优化冲突。实验表明,该方法在工具使用任务上性能提升显著,且合成数据需求极低,投资回报率优于基线。

AI 推荐理由

论文核心解决工具集成推理(TIR)中的训练范式问题,直接提升 Agent 的工具使用技能。

研究机构
Harbin Institute of Technology, Shenzhen, China Huawei Technologies Co., Ltd. Hong Kong University of Science and Technology
论文信息
作者 Weiyang Guo, Zesheng Shi, Liye Zhao, Jiayuan Ma, Zeen Zhu et al.
发布日期 2026-04-10
arXiv ID 2604.09455
相关性评分 9/10 (高度相关)