摘要
通用智能体的发展需从执行简单指令转向完成复杂的现实生产力工作流。针对现有工具使用基准与真实需求错位的问题,本文提出 GTA-2,一个涵盖原子工具使用和开放式工作流的分层基准。该基准基于真实用户查询、部署工具及多模态上下文构建。其中,GTA-Atomic 评估短程封闭任务的精度,GTA-Workflow 则引入长程开放任务以评估端到端完成度。实验揭示了显著的能力断层:顶尖模型在工作流任务上的成功率仅为 14.39%。研究还表明,检查点引导的反馈及先进的执行框架能显著提升表现,强调了执行架构设计的重要性。
AI 推荐理由
论文核心聚焦于智能体的工具使用能力评估,涵盖原子操作到复杂工作流,直接对应技能学习主题。
研究机构
上海交通大学
上海人工智能实验室
腾讯
论文信息