论文
描绘诚实的大视觉语言模型的知识边界
Delineating Knowledge Boundaries for Honest Large Vision-Language Models
摘要
大视觉语言模型(VLM)已经取得了显着的多模态性能,但仍然容易产生事实幻觉,特别是在长尾或专业领域。此外,当前模型拒绝超出其参数知识的查询的能力较弱。在本文中,我们提出了一个系统框架来增强 VLM 在面对此类未知问题时的拒绝能力。我们首先策划一个特定于模型的“Visual-Idk”(Visual-我不知道)数据集,利用多样本一致性探测来区分已知和未知事实。然后,我们使用有监督的 微调 来对齐模型,然后进行偏好感知优化(例如 DPO、ORPO),以有效地描绘其知识边界。 Visual-Idk 数据集上的结果表明,我们的方法将真实率从 57.9\% 提高到 67.3\%。此外,内部探测还表明该模型真正认识到其边界,而不仅仅是记住拒绝模式。我们的框架进一步推广到分布外的医学和感知领域,为更值得信赖和谨慎的视觉助手提供了一条稳健的道路。