论文

FactoryBench:评估工业机器理解

FactoryBench: Evaluating Industrial Machine Understanding

模型评测基准与评测资源

摘要

我们介绍了 FactoryBench(用于评估时间序列模型的基准)和 LLM 来了解工业机器人遥测的机器理解。问答对按照四个因果级别(状态、干预、反事实、决策)组织,实例化了 Pearl 因果关系阶梯,并跨越五种答案格式:四种结构化格式进行确定性评分,自由格式答案则通过 LLM 作为法官投票协议进行评分。我们提出了一个围绕结构化问题模板构建的可扩展问答生成框架,呈现 FactoryWave(从 UR3 协作机器人和 KUKA KR10 工业手臂收集的密集、多任务、多变量传感器数据集),并将 FactoryBench 构建为超过 70,000 个问答项目的大规模基准,这些问答项目基于来自 FactoryWave、AURSAD 和 voraus-AD 的大约 15,000 个标准化片段。对六大前沿LLM的零样本评估表明,没有一个模型在结构化层面上超过50%,在决策上超过18%,揭示了当前模型和操作机器理解之间的巨大差距。