摘要
针对现有视觉 - 语言代理在图像修复中依赖启发式调度导致效率低下的问题,本文提出 TIR-Agent。这是一种可训练的代理,通过监督微调与强化学习两阶段流程,直接学习工具调用策略。关键设计包括:应用于 SFT 数据的随机扰动策略以拓宽探索空间,以及多维自适应奖励机制以防止奖励欺骗。此外,开发了全局共享模型调用池以支持高吞吐异步工具调用。实验表明,该方法在多项指标上优于 12 个基线模型,并实现了超过 2.5 倍的推理加速。
AI 推荐理由
论文核心在于训练 Agent 学习最优的工具调用策略和组合,直接对应技能学习与工具使用。
研究机构
清华大学
中国 unicomp
Frontis AI
上海人工智能实验室
论文信息