Tool Learning Image Restoration Reinforcement Learning Agent Training
摘要

针对现有视觉 - 语言代理在图像修复中依赖启发式调度导致效率低下的问题,本文提出 TIR-Agent。这是一种可训练的代理,通过监督微调与强化学习两阶段流程,直接学习工具调用策略。关键设计包括:应用于 SFT 数据的随机扰动策略以拓宽探索空间,以及多维自适应奖励机制以防止奖励欺骗。此外,开发了全局共享模型调用池以支持高吞吐异步工具调用。实验表明,该方法在多项指标上优于 12 个基线模型,并实现了超过 2.5 倍的推理加速。

AI 推荐理由

论文核心在于训练 Agent 学习最优的工具调用策略和组合,直接对应技能学习与工具使用。

研究机构
清华大学 中国 unicomp Frontis AI 上海人工智能实验室
论文信息
作者 Yisheng Zhang, Guoli Jia, Haote Hu, Shanxu Zhao, Kaikai Zhao et al.
发布日期 2026-03-29
arXiv ID 2603.27742
相关性评分 9/10 (高度相关)