论文

SpatialOPSD:从经过验证的编码代理痕迹中自我提取空间情报

SpatialOPSD: Self-Distilling Spatial Intelligence from Verified Coding Agent Traces

模型优化应用与实践蒸馏视觉感知与空间理解

摘要

空间编码代理通过使用外部工具生成经过验证的执行跟踪,显着改进了多模态大型语言模型 (MLLM) 中的空间推理。然而,这种范式本质上受到推理时间开销和外部依赖性的限制。在本文中,我们探讨了 MLLM 是否可以内化这种 agentic 功能,从而完全无需工具即可运行。我们从一个简单的观察开始:用空间编码代理的汇总执行轨迹提示 MLLM 自然会解锁模型的内部空间思维链 (CoT)。受此启发,我们引入了 SpatialOPSD,这是一个策略自蒸馏框架,通过将经过验证的代理跟踪制定为特权信息,将空间推理内化到独立的 MLLM 中。为了减少蒸馏过程中的特权信息泄漏,我们引入了重复感知蒸馏,它将重复屏蔽与可能性正则化结合起来。跨多个基准的实验表明,自蒸馏 SpatialOPSD 比 SFT 实现了更高的平均准确度 和 GRPO 在空间和 OOD 数据集上,表现出卓越的性能和泛化能力。