Time Series Analysis Multi-turn Dialogue Benchmark Agentic Reasoning
摘要

时间序列数据对现实世界决策至关重要。尽管大语言模型代理能利用工具分析数据,但其在多轮对话中执行可靠时间序列分析的能力尚不明确。现有基准多关注单步任务,忽视了目标演变及基于累积证据得出结论的实际工作流。本文提出 TimeSage-MT,一个涵盖 8 个领域、包含 240 个任务的多轮代理推理基准。通过评估前沿模型及配备技能库的 TimeSage 代理,结果显示在决策导向任务上性能显著下降,主要归因于记忆、不确定性处理及领域决策的失败。该基准揭示了当前代理推理的关键差距。

AI 推荐理由

论文核心是评估 Agent 在多轮对话中的时间序列推理能力,直接针对推理机制。

研究机构
牛津大学 Vapi/Vox Intelligence 格里菲斯大学 埃因霍温理工大学 Squirrel AI Learning 东中国Normal University
论文信息
作者 Yaxuan Kong, Qingren Yao, Yuqi Nie, Yichen Li, Yilei Shao et al.
发布日期 2026-05-31
arXiv ID 2606.01498
相关性评分 9/10 (高度相关)