Time Series Benchmark LLM Evaluation Reasoning
摘要

大型语言模型在时间序列建模中表现良好,但其是否真正理解数据尚存疑。现有基准多为人工构建且领域狭窄。为此,本文提出结合模板灵活性与智能体创造性的可扩展方法,构建全面的时间序列推理基准。首先开发 TimeSeriesExam,利用合成数据评估五大核心推理类别;随后通过 TimeSeriesExamAgent,从医疗、金融等真实数据中自动生成基准。实验表明生成基准多样性媲美人工,但揭示了 LLM 在抽象及特定领域推理上的局限性。

AI 推荐理由

论文核心构建时间序列推理基准,评估 LLM 在模式识别、因果性等推理能力上的表现。

研究机构
Technische Universität München, Munich, Germany Aurora Lab, School of Computer Science, Carnegie Mellon University, Pittsburgh, US
论文信息
作者 Malgorzata Gwiazda, Yifu Cai, Mononito Goswami, Arjun Choudhry, Artur Dubrawski
发布日期 2026-04-11
arXiv ID 2604.10291
相关性评分 9/10 (高度相关)