论文
看透冲突:改善视觉语言模型中的指令层次结构对齐
Seeing Through Conflicts: Improving Instruction Hierarchy Alignment in Vision-Language Models
摘要
指令层次结构 (IH) 对齐教导语言模型在输入冲突时优先考虑更高级别的指令。虽然主要在纯文本环境中进行研究,但视觉语言模型 (VLM) 给 IH 带来了新的挑战:指令可能嵌入图像中、跨模态分割、视觉转换或在代理任务中遇到。将多模态 IH 对齐视为推理问题,我们使用强化学习和基于规则的奖励来训练 VLM,比较纯文本、纯图像和混合模态监督。我们发现纯文本 IH 训练部分转移到多模态攻击,当模型必须对跨模态的指令进行解码、重建或推理时,就会失败。基于图像的训练比纯文本监督提高了鲁棒性,而混合模态训练的总体表现最好。重要的是,其好处超出了合成印刷训练设置,扩展到真实图像和网络代理安全任务,同时在很大程度上保留了一般的多模态能力,表明轻量级、可验证的监督可以有意义地提高 VLM 在对抗性、跨模态和交互式指令冲突下的鲁棒性。