摘要
大型语言模型在时间序列建模中表现良好,但其是否真正理解数据尚存疑。现有基准多为人工构建且领域狭窄。为此,本文提出结合模板灵活性与智能体创造性的可扩展方法,构建全面的时间序列推理基准。首先开发 TimeSeriesExam,利用合成数据评估五大核心推理类别;随后通过 TimeSeriesExamAgent,从医疗、金融等真实数据中自动生成基准。实验表明生成基准多样性媲美人工,但揭示了 LLM 在抽象及特定领域推理上的局限性。
AI 推荐理由
论文核心构建时间序列推理基准,评估 LLM 在模式识别、因果性等推理能力上的表现。
研究机构
Technische Universität München, Munich, Germany
Aurora Lab, School of Computer Science, Carnegie Mellon University, Pittsburgh, US
论文信息