论文

以VLM标注和几何纠错重建田间玉米程序模型

A Vision-Language Model (VLM)-based Pipeline for End-to-End Procedural Modeling of Field-Grown Maize from Point Clouds

应用与实践视觉感知与空间理解

摘要

可编辑田间作物3D模型可支持高通量表型分析和计算机内育种试验,但从扫描点云建立模型需要器官分割与拟合。程序生成器可将器官参数转成适于分析的3D模型,获取参数却需要逐株数小时手工调整,或依赖物种专用标签训练分割模型。我们提出自动管线,从原始3D点云重建程序化玉米,无需手工调参或物种专用训练数据。多模态VLM在渲染的正交视图上标注叶片中线;确定性几何算法将标注反投影到点云,通过跨视图一致性合并3D叶片,并在方向加权表面图上把中线扩展为完整叶片。测量的器官参数填入植物描述符,供非均匀有理B样条(NURBS)程序模型生成器使用,再以可微NURBS拟合将每片叶面贴合扫描点。在MaizeField3D的100株基因型多样田间玉米上,整株Chamfer距离中位数为5.4 mm,比此前人工标注半自动管线更接近扫描。未使用参考标签作为输入时,以IoU至少0.5恢复了1023片参考叶中的1017片,即99.4%。结果表明,下游几何阶段纠错可使VLM标注成为可用的器官测量,支持现代大规模表型实验自动生成可编辑3D植物资产。