论文
DeepInsight:跨物理AI栈的统一评估基础设施
DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack
摘要
评估物理AI栈横跨相差超过三个数量级的操作符——从单个基础模型解码步到全身控制的数千物理tick——在模态、奖励语义与资源画像上正交变化。既有框架无一直跨此范围——因此该栈今天由拼接各自不具备共享运行时与评分的分离测试架来评估——保留每段局部有效性——但丢失诊断跨层回归所需的共享身份。我们呈现DeepInsight——在单一运行时上服务整个谱系的评估基础设施。它不把各机制同质化——而是把异质性保藏在三个狭窄抽象之后——任务、资源与结果——每个实现为所有子系统共享的一个不变量:一个episode驱动器、一个由每个昂贵后端(LLM推理与沙箱运行时皆然)实现的资源句柄协议——以及每条事件写入其下的一个踪迹身份方案。部署于具身人形栈全部三层的生产中——这组单一不变量使新基准的接入主要靠配置完成。在存在成熟同级编排器的地方——基础模型端——它在其自身离散度内复现已发表参照与同级框架读数——在单节点上更快运行相同套件——并跨节点近线性扩展。其独特回报是诊断性的:因为每层写入共享踪迹——始于一层、浮现于另一层的回归在该踪迹上保持可定位——这是任何逐段测试架联合都无法复现的跨层收益。
