论文

组合上下文 微调 用于从视频中理解复杂装配动作的视觉语言模型

Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos

模型训练监督微调与指令调优

摘要

装配动作理解是有效人机协作装配的关键推动因素,但由于微妙的动作和细粒度的手部物体交互,它仍然具有挑战性。我们使用组合上下文 微调 (CCFT) 使视觉语言模型 (VLM) 适应这个具有挑战性的领域,该方法将组装动作分解为语义元素(动词、对象、工具),并微调 VLM 以使用模板化问答对识别每个动作元素。这种方法确保了近乎确定性的输出。为了在有限的数据下实现高效且有效的多任务学习,提出了一种分层交替训练(LP-AT)方法,该方法分配不同的模型层以通过特定于元素的低秩适配器来识别特定的动作元素。 LP-AT 在特定于元素的适配器之间交替进行权重更新,减少跨任务干扰,同时实现每个适配器的超参数优化。此外,我们还根据现有装配视频数据集创建 HA-ViD-VQA 和 IKEA-ASM-VQA 数据集。对这些数据集的大量实验表明,我们的方法始终优于强大的动作识别基线,同时提供可解释的元素级预测,可以支持不同的下游应用程序。