论文

通过无数据平坦度感知提示预训练改进视觉语言模型测试时提示调整的校准

Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining

模型训练参数高效训练

摘要

测试时提示调整(TPT)已成为一种有前途的技术,通过使用未标记的测试数据优化文本提示来增强视觉语言模型的适应性。然而,先前的研究发现,TPT 经常会产生校准不佳的模型,引发人们对其预测可靠性的担忧。最近的工作通过纳入限制模型输出的附加正则化项来解决这个问题,这改善了校准,但通常会降低性能。在这项工作中,我们揭示了这些正则化策略隐含地鼓励向更平坦的最小值进行优化,并且适应提示周围的损失景观的锐度是控制校准质量的关键因素。受这一观察的启发,我们引入了平坦度感知提示预训练(FPP),这是一种简单而有效的 TPT 预训练框架,可在适应之前在损失景观的平坦区域内初始化提示。我们证明,简单地替换现有 TPT 管道中的初始化(无需修改任何其他组件)就足以提高校准和性能。值得注意的是,FPP 不需要标记数据,并且在测试时调整期间不会产生额外的计算成本,这使得它对于实际部署非常实用。该代码位于:https://github.com/YonseiML/fpp。