论文
物理上可行的世界模型:查询条件具体化人工智能的案例
Physically Viable World Models: A Case for Query-Conditioned Embodied AI
摘要
实体人工智能的世界模型必须在物理上可行:通过表示控制行动结果的物理结构来回答干预查询,而不仅仅是预测未来的观察结果。现有的观察预测世界模型可以产生视觉上合理但物理上错误的展示。这种失败是结构性的;不同的物理系统可能看起来相同,但在干预下却会有所不同。我们通过受控基准来暴露这个问题,这些基准可以修复可见场景,同时改变潜在的物理现象。我们表明,此类模型可能会推荐不可行的行动、错误预测交互结果或证明不安全行为。我们认为,实体人工智能需要世界模型来识别足以回答干预查询的最简单的物理抽象。这样的模型由模块化组件组成,包括环境表示、潜在状态和参数估计、动作规范、干预动力学和查询级响应。自主编排器应该识别相关的抽象,并为每个查询组成兼容的学习和结构化组件。当封闭式物理学不可用、不确定或成本高昂时,过渡模型可以是分析的、模拟的、学习的或混合的,但它必须保留决定干预结果的结构。这种分解使得模型可解释,其组件可验证,并且其输出可根据查询进行审核。它还为新的世界模型提供了设计原则,并为现有模型提供了可行性测试:正确的抽象不是世界最详细的模型,而是保留与查询相关的区别的最简单的模型。我们针对现有系统无法正确回答的查询演示了这种方法,并概述了编排器如何动态组装和调整物理上可行的模型以进行规划、控制和验证。