论文

强制延迟:操控多模态LLM级联中的路由决策

Forced Deferral: Manipulating Routing Decisions in Multimodal LLM Cascades

模型评测安全与风险评测

摘要

虽然多模态大型语言模型 (MLLM) 显示出强大的视觉推理能力,但为每个查询提供大型模型的计算成本很高。 MLLM 级联首先查询较弱但更便宜的模型,并在弱模型的输出不确定时推迟到强模型,从而减轻了这种成本。然而,由于弱模型的置信度直接控制计算分配,这些系统暴露了一个新的攻击面:对手可以操纵置信度,以便他们的查询始终推迟到强模型。受此漏洞的启发,我们引入了强制延迟攻击(FDA),这是一种对抗性图像攻击,可降低弱模型的置信度并导致级联将查询路由到强模型。 FDA 通过优化温度平坦目标来学习通用边界触发因素。该目标将触发输入上的弱模型的令牌分布推向由其干净响应构建的不太集中的目标。在数据集、模型系列和延迟指标中,FDA 不断增加强模型路由,同时超越图像扰动和提示注入基线。这些结果表明,MLLM 级联很容易受到操纵计算分配的攻击,从而在不直接针对答案正确性的情况下强制使用非预期的强模型。

强制延迟:操控多模态LLM级联中的路由决策:论文配图
图 1:MLLM 级联上的强制延迟攻击概述。左图展示了标准级联管道,其中弱模型直接回答高置信度输入,并且仅将不确定的情况推迟到更强的模型。中间面板显示了我们的攻击过程:我们首先提取干净的输出轨迹,构建平坦的温度尺度目标分布,并使用教师强制的 KL 最小化来优化学习的边界触发。右图显示了部署效果:应用学习到的触发器会降低弱模型的置信度,导致更多输入被路由到强模型,同时保留高质量的最终答案。