论文

图像重建游戏:通过迭代多模态对话达成共识

The Image Reconstruction Game: Drawing Common Ground Through Iterative Multimodal Dialogue

模型评测基准与评测资源

摘要

我们引入了图像重建游戏,这是一种完全自动化的基准测试,其中视觉语言模型在多个回合中向图像生成器发出纠正指令,使积累的共同点可以直接观察为渲染图像。对七个图像类别中的两个描述器模型与两个生成器模型的交叉进行基准测试,我们发现描述器是重建质量的主导因素,而生成器则决定迭代细化是有帮助还是有害。数学和几何图像构成了最大的挑战。描述者的 词元预算 强烈影响收敛:较短的预算会产生稀疏的首次渲染,并具有更大的可见改进空间,而较长的预算会提高绝对质量,但留下的修复空间较少。较强的描述者使用更丰富的校正词汇,涵盖空间、数字和结构类别,而较弱的描述者则专注于表面特性,并且往往会在几个回合后停止。人工验证表明,最好的自动判断与人类偏好仅达到轻微到一般的一致性,并且自动评分需要人工重新校准才能可靠地使用。