论文

从仿真轨迹中发现高层模式

Discovering High Level Patterns from Simulation Traces

上下文与知识上下文工程

摘要

嵌入基于物理交互的环境中的人工智能 (AI) 代理面临着许多挑战,包括推理、规划、总结和问答。当人类用户希望用自然语言指导代理或与代理交互时,这个问题会更加严重。尽管语言模型 (LM) 的使用是默认选择,但作为人工智能工具,它们在涉及物理的任务上遇到了困难。 LM 的物理推理能力是从观测数据中学习的,而不是基于模拟。一种常见的方法是将模拟轨迹作为上下文包含在内,但这会导致可扩展性较差,因为模拟轨迹包含大量细粒度的数值和语义数据。在本文中,我们提出了一种自然语言引导的方法,用于从详细的模拟日志中发现粗粒度模式(例如“刚体碰撞”、“稳定支撑”等)。具体来说,我们综合了对模拟日志进行操作的程序,并将它们映射到一系列高级激活模式。我们通过两个物理基准测试表明,这种带注释的模拟日志表示更适合关于物理系统的自然语言推理。我们演示了这种方法如何使 LM 根据自然语言指定的目标生成有效的奖励计划,这些计划可以在规划或监督学习的背景下使用。

从仿真轨迹中发现高层模式
图1:我们的方法从低层仿真轨迹中发现高层模式,无需微调即可提升LM的物理推理能力。(a) 模式发现利用进化编程从原始仿真状态中检测粗粒度模式(例如“一根杠杆把球发射出去”)。(b) 由检测代码构成的库可以为仿真轨迹加注,生成模式激活矩阵。(c) 加注后的轨迹对下游任务很有用:摘要、物理规划、问答以及奖励程序合成。(d) 一个来自自然语言目标“从两个障碍物之间穿过,把绿色的球弄进第二个桶”的奖励程序示例,经优化用于解决该任务。