论文

VLESA:用于人类活动监测的视觉语言体现安全代理

VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring

智能体系统Agent 动作执行与治理

摘要

随着人工智能系统越来越多地协助人类完成体力任务,确保安全变得至关重要——体力行为会带来直接且不可逆转的后果,而数字错误则不会。我们引入了视觉语言嵌入式安全代理(VLESA),这是一个通过以自我为中心的视频监控人类活动的框架,并在预测到危险行为时触发实时安全干预。 VLESA 解决了与意图相关的安全问题,其中相同的操作可能是安全的,也可能是危险的,具体取决于上下文。引入了将自我中心框架与目标条件安全注释配对的数据集,从而实现了通过 GRPO 训练的目标条件安全 Q 过滤器,无需重新训练即可评估与推断意图相关的操作。最重要的是,提出了一个意图动作预测代理来联合推断目标并从视频中预测未来的动作。在 ASIMOV-2.0 基准上,与基线相比,VLESA 在精确的 真值 帧上实现了更高的干预精度,而 GRPO 训练的 Q 滤波器通过目标条件约束解码将动作安全性提高了 41 个百分点以上。代码可在 https://github.com/Han JiangHu/VLESA 获取。