论文
论多模态 LLM 法官的对抗鲁棒性
On the Adversarial Robustness of Multimodal LLM Judges
摘要
多模态 大语言模型 (MLLM) 越来越多地用作自动判断,例如用于图像质量和安全评估。然而,它们的对抗鲁棒性在很大程度上仍未得到探索,威胁着自动判断的公平性和可靠性。为了弥补这一差距,我们引入了 RobustMLLMJudge,这是第一个用于评估通用 MLLM 在充当法官时的对抗鲁棒性的通用框架。它涵盖了针对质量和安全评估场景中流行的判断方法的各种攻击。使用 RobustMLLMJudge,我们发现 i) 不同的 MLLM 法官非常容易受到分数夸大的对抗性攻击; ii) 虽然有效,但由于 MLLM 法官评估协议的独特限制,这些攻击方法面临着严峻的挑战。我们进一步提出 MGSIA,即流形引导语义归纳攻击,这是一种绕过这些约束的新方法,可以对 MLLM 法官进行更有效和可转移的攻击。 MGSIA 的核心思想是将肯定语义归纳与高分流形对齐相结合:它最大化判断对二进制语义查询产生肯定响应(例如“是”)的概率,同时规范化针对从代理协议估计的高分中心的对抗性表示。这些目标共同产生了可转移的分数夸大扰动。大量实验证明了 MGSIA 在不同评估场景下欺骗高级 MLLM 法官的优越性和普遍性,凸显了对稳健 MLLM 法官的需求。代码和数据将在 https://github.com/mala-lab/RobustMLLMJudge 上提供。