论文

无需训练 通过校准剩余解码进行 VLM 个性化

Training-Free VLM Personalization via Calibrated Residual Decoding

模型推理解码与生成控制

摘要

视觉语言模型可以通过在推理时直接提供用户配置文件、偏好或视觉参考,以 无需训练 的方式进行个性化,而无需更新模型参数。然而,直接的个性化提示并不能保证模型能够可靠地利用此类证据。积极用户配置文件下的预测分布通常混合两个来源:当前配置文件真正支持的个性化信号,以及模型的通用视觉或语言先验。因此,仅从积极的配置文件响应中,很难确定高置信度的答案是否得到用户配置文件的支持,或者仅仅反映了模型的默认偏好。为了解决这个问题,我们提出了一个 无需训练 校准残差解码框架。给定相同的图像和问题,我们构建三个证据条件:积极的概况、反事实的概况和空的概况。我们的方法将预测作为锚定基础,并根据三种条件的分数差异明确估计个性化的边际贡献。我们进一步引入基于归一化熵的不确定性校准,允许个性化增强的强度适应残差信号的可靠性。在 MMPB、YoLLaVA 和 MyVLM 上的实验表明,所提出的方法无需 微调 即可提高个性化多模态理解,并且在身份敏感的视觉个性化任务上获得一致的收益。附加分析表明,当对比个性化信号不确定时,熵校准可以稳定残差解码。