论文
VitaTouch:用于制造过程中机器人质量检测的属性感知视觉触觉语言模型
VitaTouch: Property-Aware Vision-Tactile-Language Model for Robotic Quality Inspection in Manufacturing
摘要
智能制造中的质量检测需要识别可见几何形状之外的内在材料和表面特性,但仅视觉的方法仍然容易受到遮挡和反射的影响。我们提出了 VitaTouch,一种用于材料属性推断和自然语言属性描述的属性感知视觉触觉语言模型。 VitaTouch 使用特定于模态的编码器和双 Q-Former 来提取与语言相关的视觉和触觉特征,这些特征被压缩为 大语言模型 的前缀标记。我们将每种模式与文本结合起来,并通过对比学习明确地将视觉和触觉结合起来。我们还构建了 VitaSet,一个包含 186 个对象、52k 个图像和 5100 个经过人类验证的指令-答案对的多模式数据集。 VitaTouch 在 HCT 和整体 TVL 基准上实现了最佳性能,同时在 SSVTP 上保持竞争力。在VitaSet上,硬度精度达到88.89%,粗糙度精度达到75.13%,描述符召回率达到54.81%;材料描述任务进一步实现了 0.9009 的峰值语义相似度。借助基于 LoRA 的 微调,VitaTouch 在 2 类、3 类和 5 类缺陷识别方面分别实现了 100.0%、96.0% 和 92.0% 的准确率,并在 100 次实验室机器人试验中实现了 94.0% 的闭环识别准确率和 94.0% 的端到端分拣成功率。更多详细信息请访问项目页面:https://vitatouch.github.io/