摘要
本文提出 FactoryBench,一个用于评估时间序列模型和大语言模型在工业机器人遥测数据上机器理解能力的基准。该基准依据 Pearl 因果阶梯的四个层级(状态、干预、反事实、决策)组织问答对,涵盖五种答案格式。作者提出了基于结构化模板的可扩展问答生成框架,并发布了 FactoryWave 数据集。对六个前沿 LLM 的零样本评估显示,其在结构化层级和决策任务上的表现均不足,揭示了当前模型与 operational 机器理解之间的巨大差距。
AI 推荐理由
论文基于因果阶梯评估 LLM 的推理能力,重点在于状态、干预及决策层面的逻辑理解。
研究机构
ETH Zürich
UC3M
Imperial College London
University of Berkeley
KTH Royal Institute of Technology
University of Vienna
论文信息