论文

TecoPrompt:视觉语言模型的时间保守即时学习

TecoPrompt: Temporal-Conservative Prompt Learning for Vision-Language Models

模型训练监督微调与指令调优

摘要

即时学习通过调整一小组上下文标记来适应视觉语言模型,例如 CLIP。然而,在少数样本监督下,即使是适度的标签噪声也会破坏即时优化。为了解决这个问题,我们提出了 TecoPrompt,这是一个闭环鲁棒提示学习框架,它从时间角度重新审视最佳传输(OT)伪标签。 TecoPrompt 在 CLIP 语义空间中采用熵 OT 计划来获得全局一致的候选标签。它通过检查轨迹稳定性来验证这些候选者的可靠性:只有当 OT 候选者在 K 纪元时间稳定性窗口内保持不变并通过基于指数移动平均线 (EMA) 的置信门时,噪声标签才会被重写。这种方法有助于减少确认偏差。然后,使用三组目标将重写的标签重新集成到即时训练中,该三组目标包括与干净、中间和噪声子集对齐的三个损失函数。对具有合成对称和非对称噪声的七个数据集以及 Food101N 进行的实验表明,性能显着提高。例如,在 OxfordPets 数据集上,在具有 50% 不对称噪声的情况下,TecoPrompt 的准确度从 0.775 提高到 0.843。