论文
面向具身智能体原位评估的自动认知任务生成
Automatic Cognitive Task Generation for In-Situ Evaluation of Embodied Agents
摘要
随着通用智能体即将在各类家庭中大规模部署,针对每个独特的未见3D环境进行定制化评估已成为关键前提。然而,现有基准存在严重的数据污染且缺乏场景特异性,不足以评估智能体在未见场景中的能力。为解决这一问题,我们受人类认知启发,提出一种针对未见环境的动态原位任务生成方法。我们通过结构化图表示来定义任务,并构建面向具身智能体的两阶段交互-演化任务生成系统(TEA)。在交互阶段,智能体主动与环境交互,在任务执行与生成之间形成循环,从而支持持续的任务生成。在演化阶段,任务图建模使我们能够重组并复用已有任务来生成新任务,而无需外部数据。跨10个未见场景的实验表明,TEA在两个周期内自动生成了87,876个任务,人工验证确认这些任务在物理上合理并涵盖基本的日常认知能力。在我们的原位任务上将SOTA模型与人类进行基准对比后发现,模型尽管在公开基准上表现出色,却在基本感知任务上表现得出奇地差,严重缺乏3D交互意识,并且在推理上对任务类型高度敏感。这些发人深省的结果凸显了在将智能体部署到现实人类环境之前进行原位评估的必要性。
