论文
DVLA-RL++:双级视觉语言对齐与强化学习门控,用于少样本学习
DVLA-RL++: Dual-Level Vision-Language Alignment with Reinforcement Learning Gating for Few-Shot Learning
摘要
少样本学习旨在从有限的标记示例中识别新类别。最近的研究结合了文本语义来补偿有限的视觉观察并改善类别表示。然而,图像-文本的高度一致性可能反映了内在的对象属性和附带的上下文,使得支持原型容易受到上下文污染。为了解决这个问题,我们提出了 DVLA-RL++,它通过补充语义纯化(CSP)和反事实强化学习门控(CRG)扩展了 DVLA-RL。具体来说,CSP 从标记的支持生成内在的和令人讨厌的描述,并将它们的协议与每个支持token进行比较。模糊性相关的拒绝裕度指导稀疏证据分配,而内在语义锚填充未分配的质量,以在视觉证据不可靠时提供后备。 CRG 使用平衡识别性能和滋扰暴露的奖励来学习分层语义融合优势。同一情节上独立执行的参考轨迹提供了配对 学习信号。理论分析将保留的证据和锚定质量与原型稳定性联系起来,并为无偏的策略梯度估计建立条件。标准、细粒度和跨域基准测试的实验显示了最先进的准确性,与 DVLA-RL 相比平均增益为 1.4%。项目页面可在https://peacelwh.github.io/TPAMI27-DVLA-RLpp/.获取