摘要
针对工具调用代理评估滞后且无法实时纠错的问题,本文提出将评估移至推理执行循环中。通过引入专门的审查代理在执行前评估临时工具调用,实现从被动恢复向主动纠错的范式转变。文章定义了“有益性 - 有害性”指标以量化审查带来的权衡,并在多基准测试中验证了该方法能显著提升任务表现。研究表明,分离执行与审查架构可通过模型选择和提示优化系统性提升代理能力,无需重新训练基础模型。
AI 推荐理由
论文核心研究工具调用代理的实时评估与纠错机制,直接提升技能执行准确性。
研究机构
Apple
论文信息