论文

DeepInsight II:从基准到机器人的同源轨迹

DeepInsight II: One Trace from Benchmark to Robot

智能体系统Agent任务评测

摘要

在整个Physical AI栈中,评估成熟度与部署风险呈反向对齐:基础模型享有成熟、标准化的评测工具,而部署真正依赖的具身层却碎片化于各基准专属的模拟器、本体和接口之间。第一份DeepInsight报告(v1)通过任务、资源、结果三个抽象统一了该栈的评估,但其定量证据集中于基础模型层;导航与操作(System 1)和全身控制(System 0)仍停留在模拟案例研究,物理执行不在其经验范围内。DeepInsight II保持该底座不变,量化具身的一半。第一,它在两个导航基准和四个操作基准上按各自原生协议复现已发布检查点的参考结果。第二,MotionBench把四个已发布的全身控制器置于同一工作负载与指标契约下,然后将一个合格的族内队列从并行仿真带到匹配的真机试验,仿真与物理rollout共享父轨迹身份同时保留各自执行域专属的记录,使sim-to-real差距成为原生归约而非跨工具链的对账。第三,一个组合的System 2–1–0研究把轨迹定位扩展为五个证据支撑的交接标签,每个标签映射到一个具体的修复动作,配有实测的可修复性判据,并在硬件可观测状态下用物理回合检验相同的归因。因此,其贡献不是新的评估架构,而是从基准执行到匹配的机器人证据与面向修复的诊断之间的经验连续性。

DeepInsight II:从基准到机器人的同源轨迹:论文配图
图1:本报告的具身证据,均在同一次运行时之上:遵循原生基准协议的 System 1 检查点、在仿真与实体机器人之间匹配一致的 System 0 运动,以及一个组合式 System 2–1–0 回合——其被诊断到具体修复,并在仿真与实体机器人上重新测试。代表性 H2 帧展示朝向修复前后的状态。每次 rollout 都写入一个以身份寻址的轨迹(trace),因此三类证据共享单一的结果表示。