论文
统一传感器、语言与动作的基础模型
Sensor-Language-Action Models
摘要
传感器不仅对于了解世界很有用,而且对于决定下一步该做什么也很有用。然而,现有的传感器模型很大程度上停留在感知上:它们识别状态或预测结果,通过特定于任务且通常封闭的标签空间单独建模动作。我们引入了传感器-语言-动作 (SLA) 建模,这是一个将多模态传感器观测、自然语言和动作连接到一个统一模型中的框架。 SLA 使用语言作为感知和动作之间的语义接口,允许表示、预测和解释异构动作,同时保持基础传感器证据的基础。我们构建了一个大规模 SLA 基准,其中包含涵盖超过 116,000 名个人、79 种传感器模式和 60 个操作组的数据集,以及协调用户上下文、传感器动态和操作证据的多方面字幕管道。在此框架的基础上,我们提出了 OpenSLA,这是一个用于分层动作预测、状态理解和动作解释的统一 SLA 模型。对临床预测、手术室和代谢健康等现实世界任务的大量实验验证了其优于最先进技术的性能。 OpenSLA 还展示了一些有趣的功能,包括语言引导的证据基础和对未见过的动作和群体的零样本泛化。
