论文
PRISM:用于测量和完善多模态类比的范畴理论框架
PRISM: A Category-Theoretic Framework for Measuring and Refining Multimodal Analogies
摘要
类比推理涉及识别和保留跨领域的关系结构。然而,现有的人工智能驱动的多模态类比生成方法缺乏可解释的措施来衡量这种结构是否在生成的输出中被理解和维护。我们通过可解释结构映射的回拉细化(PRISM)来解决这一差距,这是一种与模态无关的框架,用于测量和改善多模态类比中的关系对齐,并根据视觉隐喻生成进行评估。 PRISM 将类比表示为基于范畴论的显式关系映射,并使用 VLM 跨模态实例化这些结构。它的第一个组成部分,回调分数,量化了结果图形表示中的关系对齐。在AnaloBench基准测试中,纯粹通过回调分数选择正确的类比可以达到82.5%的准确率,表明该分数捕获了有意义的关系信息。 PRISM 的第二个组件是迭代细化循环,它使用回拉分数作为上下文反馈信号,以迭代方式修改生成的图像以实现更大的关系深度。 VLM 作为评审和人类评估表明,与零样本生成相比,PRISM 持续提高了隐喻一致性和类比适当性,人类参与者在 57.65% 的成对比较中更喜欢精致的输出。然而,定性分析表明,细化可能有利于视觉上拥挤的构图,而不是真正更深层次的关系对应。