论文

BIRD:将决策边界提炼为 MLLM 适应的基本原理

BIRD: Distilling Decision Boundaries into Rationales for MLLM Adaptation

模型训练监督微调与指令调优

摘要

将通用多模态大语言模型(MLLM)适应专门领域需要学习特定领域的决策标准,这通常取决于其他看似合理的答案之间的微妙视觉区别。基本原理增强旨在通过额外的观察或样本间比较来揭示此类证据,但视觉上有效的提示不一定与决策相关:它可以描述样本的差异,而不改变模型在竞争答案之间的相对偏好。因此,我们引入了 BIRD,这是一个自我改进的边界知情基本原理蒸馏框架,它使用特定于模型的混淆来定位未解决的局部决策边界,并将解决这些混淆的证据提取为基本原理。对于每个样本,BIRD 从目标 MLLM 自己的表示空间中检索候选邻居,并根据其答案偏好选择最容易混淆的一个。然后,它根据视觉差异生成答案盲的候选证据,并在功能上验证哪些证据最有效地增强模型对正确答案的偏好,同时避免在配对之间进行不当转移。然后,经过验证的证据被提炼为标准监督微调的单样本基本原理。医学和图表 VQA 实验表明,BIRD 在两个目标 MLLM 上的性能优于竞争性的理由增强方法,而进一步的分析表明,可更清晰地分离令人困惑的答案,并从模型匹配的监督中获得更大的收益。