Benchmark Causal Reasoning Industrial AI LLM Evaluation
摘要

本文提出 FactoryBench,一个用于评估时间序列模型和大语言模型在工业机器人遥测数据上机器理解能力的基准。该基准依据 Pearl 因果阶梯的四个层级(状态、干预、反事实、决策)组织问答对,涵盖五种答案格式。作者提出了基于结构化模板的可扩展问答生成框架,并发布了 FactoryWave 数据集。对六个前沿 LLM 的零样本评估显示,其在结构化层级和决策任务上的表现均不足,揭示了当前模型与 operational 机器理解之间的巨大差距。

AI 推荐理由

论文基于因果阶梯评估 LLM 的推理能力,重点在于状态、干预及决策层面的逻辑理解。

研究机构
ETH Zürich UC3M Imperial College London University of Berkeley KTH Royal Institute of Technology University of Vienna
论文信息
作者 Yanis Merzouki, Coral Izquierdo, Matei Ignuta-Ciuncanu, Marcos Gomez-Bracamonte, Riccardo Maggioni et al.
发布日期 2026-05-08
arXiv ID 2605.07675
相关性评分 8/10 (高度相关)