论文
人类与视觉语言模型:叙事连贯性的统一衡量
Humans vs Vision-Language Models: A Unified Measure of Narrative Coherence
摘要
我们通过将人类书写的叙述与视觉写作提示语料库上的视觉语言模型(VLM)生成的叙述进行比较,研究视觉基础故事中的叙述连贯性。使用一组捕获叙事连贯性不同方面的指标,包括共指、话语关系类型、主题连续性、人物持久性和多模态人物基础,我们计算叙事连贯性得分。我们发现 VLM 显示出大致相似的相干性特征,但与人类的相干性特征存在系统性差异。此外,个别措施的差异通常很微妙,但当综合考虑时,差异就会变得更加明显。总体而言,我们的结果表明,尽管模型叙事表面上与人类相似,但在如何组织基于视觉的故事中的话语方面,模型叙事表现出与人类的系统性差异。我们的代码可在 https://github.com/GU-CLASP/coherence-driven- humans 获取。