论文
IntroConformal:通过内省信号保证大型视觉语言模型的共形事实性
IntroConformal: Conformal Factuality Guarantees for Large Vision-Language Models via Introspective Signals
摘要
大型视觉语言模型 (LVLM) 已经实现了强大的多模态性能,但确保生成内容的事实正确性仍然具有挑战性。提供真实性统计保证的现有方法通常依赖于外部验证器或生成时置信度信号,这会引入辅助依赖关系,或者经常因自信但不正确的输出而失败。我们认为,可靠的事实控制可以通过从模型本身得出的内省信号来实现。我们引入 IntroConformal,这是一个 无需训练 保形风险控制 (CRC) 框架,它提供有限样本、无分布的事实保证。我们首先用分层语义稳定性(从隐藏状态表示派生的一致性分数)来实例化它,然后提出验证概率,这是一个更强的分数,捕获模型对声明真实性的自我管理判断。在多个 LVLM 架构中,IntroConformal 满足保形风险保证,同时大幅减少弃权并实现相对于基于外部验证者的基线的竞争性或优越的索赔级别歧视。