论文
用于视觉语言模型可靠自动化推理的伪代码引导结构化推理
Pseudocode-Guided Structured Reasoning for Automating Reliable Inference in Vision-Language Models
摘要
视觉语言模型(VLM)正在成为机器人自动化高层推理的基石,使机器人能够解析自然语言命令并感知其环境。然而它们易受幻觉影响,会在决策中引入关键性失效,给物理部署带来重大的安全与可靠性风险。真实任务的开放式特性加剧了这一挑战:问题在难度与模态上差异巨大,需要鲁棒且可适应的推理策略。为应对这一问题,我们提出伪代码引导结构化推理框架(PStar),自适应地选择结构化伪代码推理路径,帮助VLM进行灵活的逐步推理。我们首先设计一组抽象推理函数,并构建一个结构化伪代码库来表示模块化推理策略。关键的是,我们设计了难度特征向量(DFV),使模型能够评估问题复杂度并自适应地选择合适的推理策略,从而增强鲁棒性与可解释性。大量实验表明,PStar显著降低幻觉率,在POPE上取得87.1%、在MMStar上取得68.0%的最先进分数,甚至超越GPT-4V。通过提供经过验证的视觉-语言错误削减机制,PStar朝向在真实自动化系统中部署更可信、更确定性的VLM迈出关键一步——在这类系统中,此类错误可能导致灾难性后果。
