论文

用于小型 VLM 的少镜头工业视觉的答案条件思想链 蒸馏

Answer-Conditioned Chain-of-Thought Distillation for Few-Shot Industrial Vision with Small VLMs

摘要

在制造业中部署基于人工智能的视觉检测很困难,因为需求经常变化、新的缺陷类型出现,并且很少有大型标记数据集可用。我们提出了答案条件思维链(CoT)蒸馏,用于使用最少的标记数据快速使小型视觉语言模型(VLM)适应新的工业任务。前沿 VLM 接收每个训练图像及其正确标签,并生成合理的视觉解释。然后通过 LoRA 对这些推理增强示例对 3B 参数模型进行微调。通过以正确答案为条件,我们确保所有训练推理都指向正确的结论,这一点至关重要,因为前沿模型在我们最困难的任务上得分低至 24.1%。我们对涵盖三种图像模式的四个工业分类任务进行了验证,每个任务仅使用 18 到 30 个标记图像。在每个任务 4 个种子(32 次训练运行)中,我们的方法在所有 16 个种子任务组合上都优于直接 微调,平均改进 +1.7 到 +4.4 个百分点。受控等预算实验证实,改进来自推理质量,而不是额外的训练步骤。无条件基线表明,如果没有答案条件,错误的推理会使表现降低 17.8 个百分点。在焊缝射线照片分类方面,经过微调的 3B 模型仅使用 24 个训练图像,其性能就比 GPT-4.1 高出 10.0 个百分点。