摘要
现有评估常忽视工具使用的时序维度及响应延迟影响。本文提出 AsyncTool 基准,旨在评估 LLM Agent 在具有延迟反馈的交互式多任务环境中的异步工具调用能力。该基准通过混合数据演化策略构建多样化数据集,模拟真实延迟并并发呈现异构任务。实验表明,延迟反馈显著挑战当前 Agent 性能,优秀的任务协调与状态维持能力是关键。本研究揭示了现有失败模式,为提升系统时序推理与协调能力提供洞察。
AI 推荐理由
论文核心评估 Agent 在延迟反馈下的异步工具调用能力,直接关乎技能学习效率。
研究机构
University of Science and Technology of China
University of Toronto
论文信息