Time-Series QA Benchmark Agentic Framework Skill Evaluation
摘要

大语言模型与时序语言模型日益应用于时间序列问答(TSQA)。不同于纯文本问答,TSQA 要求模型基于不同尺度、特定时间点或跨区间的时间信号进行推理。现有基准难以诊断底层信号级能力。本文提出 TS-Skill,一个用于评估三种可组合分析技能(时序尺度选择、时序定位、跨区间整合)的控制性基准。为大规模构建该基准,开发了 SKEvol,一种技能导向的代理框架,结合领域感知种子生成、技能控制问题生成及多阶段验证。实验揭示了模型在不同技能上的显著能力差距,证明技能级评估能揭示被总分掩盖的推理缺陷。

AI 推荐理由

论文核心提出评估时间序列问答中三种可组合分析技能的基准,并构建技能导向的代理框架。

研究机构
University of California, Los Angeles Samsung Research America Carnegie Mellon University Microsoft Amazon
论文信息
作者 Liying Han, Kang Yang, Oliver Wang, Jason Wu, Pengrui Quan et al.
发布日期 2026-05-23
arXiv ID 2605.24703
相关性评分 9/10 (高度相关)