论文
激光雷达语言模型真的理解时空关系吗?
Do LiDAR Language Models Really Understand Spatio-temporal Relationships?
摘要
最近的 4D LiDAR 语言模型旨在推理物体及其不断变化的空间关系。然而,在我们的评估中,始终选择相同的选项几乎与两个 B4DL 派生配置的多项选择准确性相匹配。我们推出了 LiDAR-Hallu,这是一种几何参考基准和诊断协议,包含 150 个 nuScenes 场景中的 10,000 个问题。它涵盖了物体存在、自我相对位置、距离排序、相对运动和时间定位,并具有选择物体、比较时间和确定参考答案的明确规则。我们的协议结合了固定答案和候选内容控制、具有相同提示但相反参考答案的跨场景对以及特定于关系的回忆。对 100,000 个记录响应的分析揭示了被总体准确性隐藏的故障。仅候选持续时间就可以在不观察 LiDAR 的情况下预测时间答案。在配对问题上,模型经常对需要相反答案的场景给出相同的答案。特定关系的分析进一步表明,两种配置都错过了所有测试条件下的每一个积极的横向运动情况。时间混洗对比解码几乎没有提供什么净改进,因为修复很大程度上被新错误所抵消,而且主要故障仍然存在。这些结果表明,评估时空推理需要测试模型是否区分所查询的物理关系,而不是仅仅依赖于个人答案的准确性。源代码、检查点和数据在此 https URL 发布。