论文
MIRAGE:用于多人物艺术品扎根探索的微交互关系架构
MIRAGE: A Micro-Interaction Relational Architecture for Grounded Exploration in Multi-Figure Artworks
摘要
欣赏多人物绘画需要了解人物如何通过目光对准、手势和空间布置等微妙线索进行联系。我们提出了 MIRAGE,一个以证据为中心的框架,旨在支撑对多人物艺术品中这些“微交互”的探索。虽然这些线索对于深入的叙事欣赏至关重要,但它们通常分布在复杂的场景中,观众很难系统地识别。现有的视觉语言模型(VLM)经常无法提供可靠的帮助,提供缺乏可追溯的视觉证据的无根据的解释。 MIRAGE 通过构建捕获身份、姿势线索和凝视假设的结构化中间表示来解决这个问题。然而,挑战不仅仅在于提取这些线索,还在于在解释过程中协调它们。如果没有明确的机制来组织和协调关系证据,即使有低水平的信号可用,模型也常常将多个相互作用假设分解为单个不稳定或基础薄弱的叙述。这种表示允许用户验证高级解释如何锚定在低级视觉事实中。通过将空间基础与叙事生成分开,MIRAGE 使用户能够通过可验证的证据层检查和推理图形之间的关系。我们使用盲评估协议根据仅绘画的 VLM 基线来评估 MIRAGE。结果表明,MIRAGE 显着提高了身份一致性,减少了关系幻觉,并增加了微妙互动的覆盖范围。这些发现表明,结构化基础可以作为关键的交互控制层,为对复杂视觉叙事进行更可靠、透明和以人为主导的理解提供必要的脚手架。