论文
SocialVLA:人类反应驱动的VLA失败干预网关
SocialVLA: A Social Perception Gateway for Human-Reaction-Based Failure Detection and Recovery in VLA Manipulation
摘要
视觉-语言-动作(VLA)策略支持多样的机器人操作,但执行中可能失败而不自知。人类观察者提供互补信号:意外的机器人行为会在失败完成前触发快速的发声、面部或言语反应。我们提出SocialVLA,一个本地化、策略无关的社交感知网关,把自发人类反应转为VLA操作的运行时干预信号。它结合因果副语言音频检测、视觉反应识别、显式停止短语与机器人相关性估计;异步首事件融合机制从最早的足够自信信号触发VLA暂停,独立语音通道捕获用于参与者主导继续、重启或指令修订的口头纠正。我们在物理Unitree G1操作上用15名参与者评估:238个标注的值得干预回合与1.038小时非干预行为。冻结离线回放召回54.6%、精确率69.5%;未过滤音视频融合召回64.3%;相关性估计把误停回合从100降到57、精确率从60.5%升至69.8%。对第16名未见参与者的前瞻部署中,冻结系统召回59.5%、精确率91.7%。检测到融合中位延迟47.9毫秒,VLA门到物理暂停336毫秒,反应起始到暂停1.021秒。结果展示了从自发社交反应到物理VLA中断与参与者主导恢复的完整本地通路。