论文

OctLLM:八叉树作为显式3D语言

Octrees as an Explicit 3D Language

模型架构混合架构

摘要

现有3D大语言模型在两方面妥协:把形状压缩为潜码本索引或坐标文本,使模型观测不到空间结构;并通过微调骨干获得3D模态,覆盖其通用语言能力。我们提出OctLLM解决两者:几何以显式的八叉树占据token序列进入,但完整八叉树序列随深度快速增长,因此随机清空倒数第二层节点并省略后代,在保持形状的同时得到更短、以坐标与深度为锚的稀疏八叉树(S-Octree),用于位置感知的掩码建模生成与3D理解。模态引入方面,现有方法用全参微调或LoRA引入新模态:全参微调代价高、LoRA限制3D容量且两者都改动语言通路。OctLLM转而在与预训练参数分离的参数中加入3D能力:mesh token经由部分块中的独立可训练分支路由,文本与图像token保持冻结的视觉语言通路,两流通过共享自注意力交互。其训练参数远少于全参微调,却在统一多模态LLM中创下新SOTA:image-to-3D FID较ShapeLLM-Omni降低17.4%、渲染依据的描述提升28.7分,同时通用语言基准与骨干持平。