摘要
集成工具的 LLM 虽能执行现实动作,但可靠性仍是瓶颈。本文指出失败源于工具调用准确性与工具内在准确性,而后者常被忽视。我们推出 OpenTools,这是一个社区驱动的工具箱,通过标准化模式、轻量级封装及自动化测试套件来提升可靠性。该系统包含公开演示平台,支持用户贡献测试用例以动态更新可靠性报告。实验表明,社区贡献的高质量专用工具在多个基准任务上比现有工具箱提升了 6%-22%,显著改善了端到端复现性与任务表现。
AI 推荐理由
论文核心解决工具使用可靠性,提出标准化架构与评估体系,直接提升 Agent 技能。
研究机构
University of Notre Dame
论文信息