论文
EMBER-Bench:长期具体任务中的跨事件因果记忆基准测试
EMBER-Bench: Benchmarking Cross-Event Causal Memory in Long-Horizon Embodied Tasks
摘要
终生的身体智能体必须对长期的互动进行推理,过去的事件在从视野中消失很久之后仍然继续塑造着世界。除了回忆发生的事情之外,智能体还必须推断历史如何改变当前状态并限制未来的行动。然而,现有的体现和视频记忆基准测试主要集中在历史检索和总结上,而这种依赖于历史的因果推理尚未得到充分探索。我们引入了 EMBER-Bench,这是一个以自我为中心的基准,用于长期具体任务中的跨事件因果推理,为此我们新创建了任务设计、视频记录和数据注释。它包含 189 个家庭任务和 699 个 QA 对,涵盖任务进度、故障恢复、外部干预以及具有远程依赖性和先决条件的复合长期任务,并具有细粒度的事件和因果链注释。 EMBER-Bench 评估两个方向的推理:下一步行动预测从历史中选择下一个行动,而因果追溯(给定该行动)识别使其成为必要的历史事件。输入消融,将动作日志或特权因果注释添加到视频中,指示哪种历史信息模型无法使用。在 16 个评估模型中,总体准确率最高为 61.2%,而两名人类评估者的平均准确率为 98.3%。在成对的决策点,正确的回溯与正确的下一步动作预测无关。添加操作日志可增加 1.6 分,而因果注释则可额外增加 13.0 分。这些结果表明,从过去的事件中提取因果信息并将其转化为对当前行动的约束仍然是智能体长期发展的关键困难。项目页面:https://zhaoalexgoat.github.io/EMBER-Bench/
