论文

迈向可泛化的、以视觉为依据的家用设备探索

Towards Generalizable Visually Grounded Exploration of Household Devices

智能体系统Agent任务评测

摘要

视觉语言模型 (VLM) 的最新进展在静态视觉识别和高级语义推理方面展现了令人印象深刻的能力。然而,当前的具体探索范式仍然严重依赖于人类注释轨迹的模仿学习,这严重限制了智能体的泛化能力。实现通用自主实体的关键瓶颈在于可推广的视觉探索:通过主动将抽象的世界知识融入细粒度的视觉可供性,无需手册或特定训练即可操作新颖设备的能力。然而,现有的基准测试未能评估这种能力:它们通常依赖于明确的文档和带注释的轨迹,忽略了功能设备操作所必需的动态假设-交互-细化过程。为了弥补这一差距,我们引入了 VGEBench,这是一个综合基准测试,旨在评估 VLM 的通用视觉探索能力。与静态数据集不同,我们构建了逻辑驱动状态机框架。该框架模拟多轮交互循环,迫使智能体通过主动视觉感知和反馈驱动的校正来实现目标。实验结果表明,现有的 VLM 在将语义知识转化为物理执行和维持长期状态跟踪方面面临着重大挑战。

迈向可泛化的、以视觉为依据的家用设备探索:论文配图
图1:可普遍视地探索的例子。该例子展示了一个假说-互动-精炼循环:在未能通过推动一个部件来加快速度之后,该智能体对物理反馈进行解释、更新其假设、重新评价视觉特征以确定该组件是一个可旋转的按钮,并成功纠正其动作。