论文
强制延迟:操控多模态LLM级联中的路由决策
Forced Deferral: Manipulating Routing Decisions in Multimodal LLM Cascades
摘要
虽然多模态大型语言模型 (MLLM) 显示出强大的视觉推理能力,但为每个查询提供大型模型的计算成本很高。 MLLM 级联首先查询较弱但更便宜的模型,并在弱模型的输出不确定时推迟到强模型,从而减轻了这种成本。然而,由于弱模型的置信度直接控制计算分配,这些系统暴露了一个新的攻击面:对手可以操纵置信度,以便他们的查询始终推迟到强模型。受此漏洞的启发,我们引入了强制延迟攻击(FDA),这是一种对抗性图像攻击,可降低弱模型的置信度并导致级联将查询路由到强模型。 FDA 通过优化温度平坦目标来学习通用边界触发因素。该目标将触发输入上的弱模型的令牌分布推向由其干净响应构建的不太集中的目标。在数据集、模型系列和延迟指标中,FDA 不断增加强模型路由,同时超越图像扰动和提示注入基线。这些结果表明,MLLM 级联很容易受到操纵计算分配的攻击,从而在不直接针对答案正确性的情况下强制使用非预期的强模型。
