论文

HUGIN:增强自主物流分拣的视觉语言规划

HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting

模型训练监督微调与指令调优

摘要

自主物流分拣系统(ALSS)是具身AI的一项重要工业应用,它需要在空间上不相交的相机视角上进行联合规划。我们将这一设定形式化为联合多场景理解(JMSU)。凭借开放世界视觉理解和任务规划能力,视觉语言模型(VLM)是JMSU的有力候选。然而,由于跨场景监督稀缺以及JMSU中长视觉上下文导致的注意力分散,直接将现有VLM应用于JMSU并非易事。为应对这些挑战,我们提出HUGIN,一个包含两个互补组件的训练框架。内生数据增强在运行约束下重组经验证的原子事实,而全局上下文排序使指令表征与完整视觉上下文的对齐强于与部分视觉上下文的对齐。为支持持续研究,我们基于自主物流分拣系统的四种布局构建了高质量的工业分拣数据集和基准SortingBench。在五个开源VLM上,HUGIN始终优于匹配的基线;例如,Qwen3-VL-8B在SortingBench上的准确率从63.6%提升至78.8%。额外实验验证了每个组件的有效性以及JMSU在具身任务中的溢出收益。涉及超过15,000件包裹的部署测试支持了基于VLM的自主物流分拣规划的实际可行性。

HUGIN:增强自主物流分拣的视觉语言规划:论文配图
图1:ALSS 示意图。基于 VLM,ALSS 能够根据多样化的业务需求,自动从格口(compartments)中抓取非标包裹、搬运并将其堆叠入笼车。