论文
CARGO-VL:以风险约束分组优化支持视觉语言模型的反事实仲裁
CARGO-VL: Counterfactual Arbitration with Risk-Constrained Group Optimization for Vision-Language Models
摘要
视觉-语言系统将图像与检索到的文本结合,但这些来源可能互相矛盾或共同失败来支持答案。可靠的模型必须识别可信源并避免当两者都不足够时。现有的后训练目标独立评分实例,因此无法在证据变化下强制执行一致的行为。我们引入CARGO-VL,这是一种基于组相对性的框架,优化覆盖对齐、图像正确、文本正确和两者都错(A/V/T/N)证据状态的匹配变体。其目标结合条件正确的正确性与答案不变性、源不变性和答案到拒绝转换奖励,同时一个原始-对偶控制器平衡不安全的答案与过度延迟。我们还贡献了XMC(扩展模态冲突),这是一种四条件冲突训练资源,并在CMC-Bench和Modality-Bias上进行评估。在多个种子上,CARGO-VL在处理冲突、避免未支持的答案以及平衡模态方面优于点对点基准。消融试验识别了关系性过渡信号和适应风险控制的互补益处,支持作为实用目标的反事实一致性,以实现可靠的多模证据仲裁。
