Tool Use Reinforcement Learning Research Agent Exploration Strategy
摘要

研究型 Agent 需动态结合内部推理与工具使用以从网络获取信息。针对强化学习(RLVR)中 Agent 常表现出的探索不足(如过早终止、工具使用偏差)问题,本文提出 SynPlanResearch-R1 框架。该框架通过合成工具使用轨迹来引导更深度的探索,用于冷启动监督微调,为后续强化学习提供强初始化。在七个多跳及开放网络基准测试中,该方法显著优于现有最先进基线,证明了其在提升工具探索与使用能力方面的有效性。

AI 推荐理由

论文核心在于通过合成计划优化 Agent 的工具探索行为,直接提升工具使用技能。

研究机构
中国科学院
论文信息
作者 Hansi Zeng, Zoey Li, Yifan Gao, Chenwei Zhang, Xiaoman Pan et al.
发布日期 2026-03-09
arXiv ID 2603.07853
相关性评分 9/10 (高度相关)