Tool Use Asynchronous Processing Benchmark Multi-task Learning
摘要

现有评估常忽视工具使用的时序维度及响应延迟影响。本文提出 AsyncTool 基准,旨在评估 LLM Agent 在具有延迟反馈的交互式多任务环境中的异步工具调用能力。该基准通过混合数据演化策略构建多样化数据集,模拟真实延迟并并发呈现异构任务。实验表明,延迟反馈显著挑战当前 Agent 性能,优秀的任务协调与状态维持能力是关键。本研究揭示了现有失败模式,为提升系统时序推理与协调能力提供洞察。

AI 推荐理由

论文核心评估 Agent 在延迟反馈下的异步工具调用能力,直接关乎技能学习效率。

研究机构
University of Science and Technology of China University of Toronto
论文信息
作者 Kou Shi, Ziao Zhang, Shiting Huang, Avery Nie, Zhen Fang et al.
发布日期 2026-05-27
arXiv ID 2605.27995
相关性评分 9/10 (高度相关)