ORDER:领域自适应具体化人工智能的虚拟世界基准
ORDER: A Fictitious-World Benchmark for Domain-Adaptive Embodied AI
摘要
通过持续的预训练使语言模型适应新的领域会带来一个基本的评估问题:如果训练语料库与模型已知的内容重叠,那么性能的提升就不能完全归因于新的学习而不是预先存在的知识。这对于知识密集型、轻任务 (KHTL) 机器人部署最为重要 - 药品配药、危险材料处理、特定于设施的协议,其中物理任务很简单,但管理规则是专有且安全关键的,并且广泛的现场测试成本高昂或不安全。我们引入了 ORDER(本体驱动的具体推理决策),这是一个建立在虚构世界上的基准:一个包含 342,069 个词元的合成语料库,定义了一个自洽的物理现象,不能出现在任何模型的预训练数据中。 ORDER 将包含 500 个问题的知识测试 (ORDER-BENCH) 与更难的组合任务 ORDER-SPATIAL 配对:对对象进行排序,以便在熟悉的和全新的场景中安全操作。没有适应的 GPT-4.1 在 ORDER-SPATIAL 上的得分低于机会(Kendall's tau = 0.441),表明其先验与发明的物理学发生积极冲突。经过持续的预训练,小模型在熟悉和新颖的场景上都有了显着的改进,这就像真正的世界模型归纳而不是记忆的证据。然后,我们将其应用到机器人管道中:如果没有进一步的技能适应阶段,能够很好地回答知识测试的模型通常无法生成有效的、可执行的计划,此后,即使 GPT-4.1 被授予对相同规则的检索访问权限(Kendall 的 tau = 0.848 与 0.606),小型、完全离线的模型在模拟 iiwa7 手臂上演示的完整感知到执行循环上也优于 GPT-4.1。人在环修正。自始至终,预测实际计划质量的是订单空间性能,而不是知识测试的准确性。