摘要
本文提出了 TFRBench,这是首个专为评估预测系统推理能力设计的基准。与传统仅关注数值精度不同,该基准通过多智能体框架和迭代验证循环,生成基于数值的推理轨迹,以评估模型对跨通道依赖、趋势及外部事件的分析能力。实验表明,利用生成的推理轨迹提示大语言模型,能显著提升预测准确率(平均从 40.2% 提升至 56.6%),而现成大模型在推理和数值预测上均表现不佳。该研究确立了时间序列预测中可解释性推理评估的新标准。
AI 推荐理由
论文核心是构建评估预测系统推理能力的基准,并验证推理对提升精度的作用。
研究机构
Google
University of Kentucky
论文信息