摘要
大语言模型与时序语言模型日益应用于时间序列问答(TSQA)。不同于纯文本问答,TSQA 要求模型基于不同尺度、特定时间点或跨区间的时间信号进行推理。现有基准难以诊断底层信号级能力。本文提出 TS-Skill,一个用于评估三种可组合分析技能(时序尺度选择、时序定位、跨区间整合)的控制性基准。为大规模构建该基准,开发了 SKEvol,一种技能导向的代理框架,结合领域感知种子生成、技能控制问题生成及多阶段验证。实验揭示了模型在不同技能上的显著能力差距,证明技能级评估能揭示被总分掩盖的推理缺陷。
AI 推荐理由
论文核心提出评估时间序列问答中三种可组合分析技能的基准,并构建技能导向的代理框架。
研究机构
University of California, Los Angeles
Samsung Research America
Carnegie Mellon University
Microsoft
Amazon
论文信息