Tool Use Prompt Optimization Agent Reliability
摘要

大型语言模型代理在工具数量增多且领域特定化时,常因描述模糊和指令不明确导致工具误选及参数错误。本文提出 JTPRO 框架,通过在轨迹监督设置下利用 rollout 驱动的反射机制,协同优化全局指令与单个工具的模式/参数描述。该方法旨在保留消除歧义所需的关键线索,以提升大规模工具库中的选择准确率与槽位填充精度。多工具基准测试表明,JTPRO 在整体成功率上显著优于思维链代理及现有反射优化基线。

AI 推荐理由

论文核心解决工具选择与参数实例化问题,通过联合优化提升技能使用可靠性。

研究机构
Oracle AI
论文信息
作者 Sandip Ghoshal, Anshul Mittal, Jyotika Singh, Miguel Ballesteros, Weiyi Sun et al.
发布日期 2026-04-20
arXiv ID 2604.19821
相关性评分 9/10 (高度相关)