Tool Use Agent Training Interaction Topology SFT Reinforcement Learning
摘要

训练工具使用智能体通常依赖基于结果的过滤,忽略了交互动态。本文提出 TopoCurate,一种感知交互的框架,将同一任务的多轮试验投射到统一的语义商拓扑中。通过合并等价的状态,该投影将分散的线性轨迹转化为结构化流形,明确捕捉工具调用与环境响应如何驱动有效策略与失败模式的分歧。利用此表示,我们引入双重选择机制:在监督微调中优先选择具有反思恢复和战略多样性的轨迹;在强化学习中选择具有高错误分支比的任务,以最大化梯度信噪比。实验表明该方法显著优于现有基线。

AI 推荐理由

论文核心研究工具使用智能体的训练机制,通过交互拓扑优化技能学习轨迹。

研究机构
Menhan, Beijing, China Zhejiang University, Hangzhou, China
论文信息
作者 Jinluan Yang, Yuxin Liu, Zhengyu Chen, Chengcheng Han, Yueqing Sun et al.
发布日期 2026-03-02
arXiv ID 2603.01714
相关性评分 9/10 (高度相关)