论文
教学基础模型读取毫米波:用于理解人类行为的姿势引导运动学表示
Teaching Foundation Models to Read mmWave: Pose-Guided Kinematic Representation for Human Behavior Understanding
摘要
大语言模型 代理需要感知物理环境中的人类行为。毫米波 (mmWave) 雷达提供了一种保护隐私的非接触式传感方式,但雷达观测结果很难与语言保持一致。现有的雷达语言方法通常依赖于合成数据或缺乏对人体结构和运动的明确监督。我们提出了 mmMind,一种雷达语言模型,它使用同步 3D 姿势作为仅训练监督。时空雷达编码器经过预训练以捕获身体配置和运动动力学,之后移除姿态头,以便仅需要雷达进行推理。然后将学习到的雷达表示与 LLM 对齐,以进行行为描述和时空问答。我们还推出了 mmMind-Bench,这是一个真实世界的毫米波语言基准测试,包含 23 名参与者在 7 个室内环境中进行的 17.9 小时的录音。关于描述生成、问题回答和看不见的动作泛化的实验表明,mmMind 始终优于现有的雷达语言基线,而消融则证实了姿势引导预训练的重要性。