论文

PRISM:面向序贯决策的感知推理交错

PRISM: Perception Reasoning Interleaved for Sequential Decision Making

智能体系统Agent 架构与控制循环

摘要

把基于LLM的具身智能体从纯文本环境扩展到复杂多模态 setting 仍是重大挑战。近期工作指出独立视觉语言模型(VLM)存在感知-推理-决策差距:常忽视任务关键信息。本文提出PRISM:一个经动态问答(DQA)流水线把感知(VLM)与决策(LLM)紧耦合的框架。LLM不是被动接受VLM的描述,而是批评它、以面向目标的问题探询VLM,并合成紧凑的图像描述。这种闭环交互产出锐利、任务驱动的场景理解。我们在ALFWorld与Room-to-Room(R2R)基准上评估PRISM。结果表明:(1) PRISM显著超越SOTA图像基模型;(2) 交互式目标导向感知流水线带来系统而可观的收益;(3) PRISM完全自动,免去手工问题或答案的需求。

PRISM:面向序贯决策的感知推理交错:论文配图
图 1:Prism 交错感知 (VLM) 和推理 (LLM) 的图示。给定图像和目标,Prism 的动态问答 (DQA) 使 LLM 能够向 VLM 查询任务关键信息。这会产生细粒度的、任务驱动的描述(底部),确保准确的动作预测。相反,将 VLM 和 LLM 解耦的方法会产生与任务无关的、不完整的描述,从而导致代理失败。