摘要
训练工具使用智能体通常依赖基于结果的过滤,忽略了交互动态。本文提出 TopoCurate,一种感知交互的框架,将同一任务的多轮试验投射到统一的语义商拓扑中。通过合并等价的状态,该投影将分散的线性轨迹转化为结构化流形,明确捕捉工具调用与环境响应如何驱动有效策略与失败模式的分歧。利用此表示,我们引入双重选择机制:在监督微调中优先选择具有反思恢复和战略多样性的轨迹;在强化学习中选择具有高错误分支比的任务,以最大化梯度信噪比。实验表明该方法显著优于现有基线。
AI 推荐理由
论文核心研究工具使用智能体的训练机制,通过交互拓扑优化技能学习轨迹。
研究机构
Menhan, Beijing, China
Zhejiang University, Hangzhou, China
论文信息