论文

语言模型能理解毫米波数据吗?面向毫米波雷达人体理解的大语言模型基准测试

Can Language Models Understand mmWave Data? Benchmarking Large Language Models for mmWave Radar-Based Human Understanding

模型评测基准与评测资源

摘要

大语言模型(LLM)展现了出色的推理与生成能力,促使其被用作通用的感知推理引擎。尽管视觉语言模型(VLM)等现代方法尝试将推理能力融入视觉感知,但LLM与毫米波(mmWave)模态的结合——尽管其在低光和遮挡条件下具有独特优势——在很大程度上仍未被探索。主要瓶颈源于雷达-语言数据对的稀缺、严重的跨数据集异质性以及缺乏基础性的mmWave编码器。我们通过一个最小文本化接口弥补这一空白:将每个mmWave点云序列化为简洁的自然语言,使现成LLM能够在问答(QA)设定下工作。在此基础上,我们提出mmWave-QA,首个语言条件mmWave人体感知基准。mmWave-QA聚合异构的公开mmWave数据集,通过校准感知的预处理和全局分类体系对齐实现协调,并提供自然语言QA。该基准横跨六个场景和五个QA任务,支持跨多样mmWave硬件与实验条件的标准化评估,为mmWave-LLM集成的可扩展研究奠定基础。我们进一步在mmWave-QA上评估并分析LLM,凸显其在雷达感知上的零样本推理潜力以及在视觉退化下的鲁棒性。

语言模型能理解毫米波数据吗?面向毫米波雷达人体理解的大语言模型基准测试:论文配图
图2:mmWave-QA 构建与评估流程:I) 原始毫米波数据采集与文本化——雷达数据被预处理为人类可解释且 LLM 可用的量化格式;II) 动作分类体系与标注——动作被归入层级化领域;III) QA 生成——通过人在回路的 LLM 生成多样化的 QA 对;IV) 质量审查——标注者细化并平衡 QA;V) LLM 推理——该基准支持在不同提示方式下评估语言模型。