论文
指南:用语言说明指导内部证据
GUIDE: Guiding Internal Evidence with Language Instructions
摘要
大型多模态模型遵循关于生成什么的说明,但不一定遵循关于依赖哪些证据的说明。因此,即使指令另有建议,模型也可能继续依赖与快捷方式相关的提示。我们引入 GUIDE,一个通过语言指令控制内部证据使用的框架。 GUIDE 将分组参数有效适应与指令条件门控相结合,以在推理和生成过程中调节多模式证据路径。我们进一步引入了一个路径级评估框架,该框架通过依赖敏感性、受控扰动分析、路径调制和自回归解码动力学来表征指令条件证据调制。在多模态推理、分类和生成过程中,GUIDE 诱导了证据依赖的结构化和指令一致的重新分配,同时在很大程度上保留了任务行为。 GQA、TextVQA、MM-IMDb、CREMA-D、RAVDESS 和 Flickr30K 上的实验表明,GUIDE 提高了目标证据扰动下的稳健性,并实现了跨不同多模态设置的可控调制。这表明多模式指令跟踪可以超越输出控制,扩展到调节不同证据来源如何促进模型预测。