论文
ESC:可靠视觉语言模型的情绪自我校正
ESC: Emotional Self-Correction for Reliable Vision-Language Models
摘要
视觉语言模型(VLM)在各种多模态任务中取得了出色的性能,但它们仍然容易受到不可靠推理的影响。现有的自我校正方法可以缓解这些问题,但通常依赖于 后训练 或精心设计的反馈,从而产生高昂的计算成本。在这项工作中,我们通过情感线索的视角重新审视这一挑战,询问它们是否可以在不进行额外训练的情况下激活 VLM 中潜在的自我纠正行为。 \textbf{我们发现情绪信号可以有效触发自我纠正,鼓励更加谨慎和反思性的推理}。受这一发现的启发,我们提出了 \escabstract (\textbf{\underline{E}}motional \textbf{\underline{S}}elf-\textbf{\underline{C}}orrection),一个 无需训练 自我校正框架。 ESC 引入了一个外部验证器,可以检测可能不正确的初始响应,并注入情感反馈以鼓励模型进行反思,并在无需额外训练的情况下产生更好的修改响应。跨安全性、幻觉、以视觉为中心的感知和多模态推理基准的广泛实验表明,ESC 不断提高可靠性,同时保持整体模型实用性。这些结果表明,情绪不仅可以作为一种被识别的能力,还可以作为 VLM 中可扩展自我校正的实用控制信号。 \textbf{因此,我们相信 ESC 为新的可靠的类人情感整合研究方向提供了坚实的基础。}我们的项目已在 \textcolor{red}{https://genai4e.github.io/ESC/} 上公开发布。