论文

Assistron:贝叶斯共享自治与现成的视觉语言动作模型

Assistron: Bayesian Shared Autonomy with Off-the-shelf Vision-Language-Action Models

摘要

我们提出了 Assistron,这是一种共享自治模型,利用视觉-语言-行动 (VLA) 模型来协助用户进行日常活动。我们的方法基于两个核心原则:(1)~通过利用 VLA 驱动的宏观运动自主性来最大限度地减少人类的认知和体力消耗,以及 (2)~优先考虑在关键故障点的人为干预。在用户口头语言命令的驱动下,Assistron 利用 VLA 自主执行宏观到达轨迹,节省用户的精力。在 VLA 往往会失败的接触丰富的交互中,Assistron 采用阶段感知交互检测机制并请求用户进行干预,进而通过流程匹配指导来调整 VLA 的动作生成。至关重要的是,我们的公式消除了对 VLA 微调 的需求,保护其广泛的行为先验免受灾难性遗忘,并确保模型不会成为狭隘的专家。我们在涵盖各种日常操作技能的综合多任务场景恢复基准上验证了我们的方法。实证结果表明,与纯自主基线相比,Assistron 显着提高了任务成功率,同时与传统远程操作相比,显着减少了人类认知和体力工作量,为辅助操作提供了可扩展、平稳且轻松的范例。该代码可在 https://github.com/mousecpn/Assistron.git 中找到。