论文

交互链基准(COIN):当推理遇到具体交互时

Chain Of Interaction Benchmark (COIN): When Reasoning meets Embodied Interaction

模型评测基准与评测资源

摘要

多面手的具体代理必须执行交互式、因果关系推理,不断与环境交互、获取信息并更新计划以解决长期任务,然后才能在现实生活场景中采用。例如,从柜子中取出苹果可能需要在苹果变得可见和可触及之前打开多个门和抽屉,这需要在部分可观察性下进行顺序交互。然而,现有的基准测试未能系统地评估这一基本能力。我们引入 COIN,这是一个基准,旨在通过三个关键贡献来评估现实机器人操作中的交互式推理。首先,我们构建COIN-50:日常场景中的50个交互任务,并创建因果依赖任务所需的COIN-Primitive,以及用于技能学习和泛化评估的中期复杂性的COIN-Composition。其次,我们开发了一个低成本的移动 AR 远程操作系统,并收集 COIN-Primitive 数据集,每个原始任务有 50 个演示(总共 1,000 个)。第三,我们开发了关于执行稳定性和泛化鲁棒性的系统评估指标,以评估 CodeAsPolicy、VLA 和语言条件 H-VLA 方法。我们的综合评估揭示了当前方法的关键局限性:由于视觉理解和运动执行之间存在巨大差距,模型难以完成交互式推理任务。我们对这些限制进行细粒度的分析。