论文

通过证据感知多智能体推理实现忠实的情感图像描述

Towards Faithful Sentimental Image Captioning via Evidence-Aware Multi-Agent Reasoning

智能体系统Agent 协作

摘要

情感图像图像描述 (SIC) 需要平衡情感表达与视觉保真度。现有的方法常常在这种权衡中挣扎,由于局部基础不足和缺乏情感验证机制而导致幻觉。为了解决这些限制,我们提出了 SEA-Cap,一种情感证据感知多智能体系统,用于忠实且基于证据的情感图像图像描述。 SEA-Cap 结合了情感证据挖掘器,可提取结构化的局部情感线索,将情感控制从全局属性转移到可验证的对象级证据。利用这些证据,我们的框架编排了一个协作工作流程,其中生成器、幻觉检查器和仲裁器通过共享黑板迭代地完善图像描述。通过根据挖掘的视觉证据明确审核生成的内容,SEA-Cap 可确保情感准确性和事实一致性。对两个基准数据集的大量实验表明,SEA-Cap 可以有效减轻幻觉并实现最先进的性能。