论文

R3D:以自我为中心的可穿戴设备的定量 3D 空间推理

R3D: Quantitative 3D Spatial Reasoning for Egocentric Wearables

模型评测基准与评测资源

摘要

从以自我为中心的 RGB-D 视频中进行定量 3D 空间推理是下一代可穿戴助手的关键功能。然而,现有的基准测试并未反映出处理以下方面的挑战:(1) 自然的以自我为中心的视频,(2) 提出的 RGB-D 视频输入,以及 (3) 具有挑战性的定量 3D 空间推理问答。为了填补这一空白,我们引入了 R3D-Bench(3D 推理),这是一个包含 15 种类型的 3,033 个定量空间推理问题的基准——涵盖多项选择、基于距离和体积推理问题——建立在 Aria Digital Twin 的 57 个以自我为中心的视频序列之上。为了在此数据集上设置强有力的基线,我们引入了 R3D,一种与模型无关的空间工具调用框架。与直接将 3D 信息嵌入到模型的输入表示中的现有方法相比,R3D 使用分段和深度提升的对象表示从视频构建 3D 场景。它通过八个可组合的空间工具向 LLM 提供此信息。在 R3D-Bench 上,采用 Qwen3-VL 235B 的 R3D 实现了 73.5% 的平均相对精度,大大优于最佳的深度启用基线(CuTR+Tools,61.9%)和最佳的仅 RGB 基线(Gemini 3 Flash,46.5%)。