论文

用于乐高空间物理推理的样本效率 后训练

Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning

模型训练强化学习

摘要

基于 LLM 的乐高组装需要语义基础和物理可行性。在本文中,我们确定了一种数据引起的故障模式 physhack,其中生成的组件满足物理有效性约束,同时保持几何未对齐、语义不一致或校准不良。为了应对这一挑战,我们提出了一种基于模型的数据选择方法,该方法仅使用原始训练数据的 5%,同时改进多个独立评估者之间的语义和结构对齐。我们进一步引入PVPO,一种结合物理有效性和体素空间几何奖励的强化学习方法,以增强LLM的乐高合成能力。经过 PVPO 训练的 DeepSeek-Llama-8B 在语义、结构和物理评估维度上都优于前沿 VLM Kimi-K3,即使 Kimi-K3 提供了 真值 图像作为附加参考。