论文

ReFrame:多模态大语言模型中证据引导的测试时安全对齐

ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models

上下文与知识上下文工程

摘要

多模态大语言模型(MLLM)把模型能力扩展到文本之外,但也使安全对齐愈发困难。多模态安全对齐方法必须应对跨模态越狱、安全意识失败和过度敏感拒绝。然而现有方法常依赖重训练或内部状态检查,限制了对已部署闭源MLLM的适用性,这促使了测试时安全对齐的研究。我们分析这一设定并识别出两个关键障碍——效用主导与推理惯性,它们导致模型忽视潜在风险或顺着恶意推理轨迹走下去。在这些洞察的指导下,我们提出ReFrame,一个免训练的多模态输入重构框架:两个智能体共享一个轻量的本地部署MLLM,证据生成智能体构建互补的风险与效用证据,重写与路由智能体把它转化为安全的代理提示词和图像路由决策,再调用下游MLLM,不修改下游模型也不访问其内部信息。在多个MLLM和多个基准上的实验表明,ReFrame在保持多模态效用的同时,提升了越狱防御和安全意识,并减少过度敏感拒绝。

ReFrame:多模态大语言模型中证据引导的测试时安全对齐:论文配图
图 1:现有多模态安全对准方法的局限性,凸显了测试时黑盒方法的必要性。