论文
A$^2$Safe:反事实证据对齐的自适应代理协作,实现安全有效的视觉问答
A$^2$Safe: Counterfactual Evidence-Aligned Adaptive Agent Collaboration for Safe and Effective Visual Question Answering
摘要
使用多模态大语言模型 (MLLM) 的视觉问答 (VQA) 不仅需要产生安全有效的响应,而且还需要将安全决策建立在确定风险的多模态证据之上。最近的安全调整方法改善了拒绝行为和情境风险意识,但正确的安全结果可能仍然依赖于表面的文本或视觉相关性,特别是当风险来自个体良性图像和问题内容之间的相互作用时。为了解决这个问题,我们提出了 A$^2$Safe,这是一种反事实证据对齐的自适应智能体协作框架,用于安全有效的 VQA。 A$^2$Safe 通过与输入证据对应的安全证据面板组织本地化的视觉观察、文本意图和跨模式风险关系,使安全决策的基础变得明确。反事实安全证据对齐强制执行与安全无关的变化的不变性,同时在风险关键证据发生最小程度改变时要求适当的安全状态和响应模式转换。由此产生的证据状态进一步支持适应性协作,当证据充足时能够直接回答,当证据存在风险、不确定或冲突时,可以调用政策批评和响应修订。在互补的安全关键协议和通用 VQA 协议下,A$^2$Safe 获得了 95.72 SIUO 的安全评分,将 MOSSBench 上的良性拒绝率降低至 14.67%,并以 27.8% 的词元开销保持了 78.34 的平均通用 VQA 分数。这些结果支持反事实证据一致的自适应协作,以实现安全有效的多模式问答。