论文
阿达莫(具有多模态观察的语言驱动动作Agent):虚拟人的视觉符号框架
A.D.A.M.O. (Agent for language-Driven Actions with Multimodal Observations): A Visual-Symbolic Framework for Virtual Humans
摘要
创建可信的视频需要以语言为中介的感知、推理和行动的连贯整合。一个核心挑战是将这些组件组合到基于交互式 3D 环境的控制回路中。为此,我们引入 A.D.A.M.O. (Agent for language-Driven Actions with Multimodal Observations),一种语言驱动 vh 的视觉符号框架,利用带有工具调用的预训练 vlm 在单个控制循环内统一感知、推理和操作。阿达莫维护一个双重视觉符号世界模型,该模型结合了以自我为中心的视觉输入和同步符号状态,以支持来自自然语言提示的扎根的面向任务的行为。为了支持诊断评估,我们引入了一个由 cd 分类法组织的受控任务套件,该套件将空间任务分解为程序和语言复杂性。受控场景中的实验表明,语义标签强烈影响任务完成和失败模式,减少感知模糊性,同时将失败转移到下游执行,而推理错误仍然相对较少。