论文

评估视觉文本生成中的推理保真度

Evaluating Reasoning Fidelity in Visual Text Generation

模型评测模型能力评测

摘要

最近的文本到图像(T2I)模型可以在图像中呈现高度清晰且结构良好的文本,从而支持文档生成和幻灯片生成等应用程序。然而,当复杂的解决方案必须直接通过渲染文本表达时,这些系统是否忠实地保留了推理能力,或者它们是否只是模仿表面层模式,目前尚不清楚。我们通过评估视觉文本生成中的推理保真度来研究这个问题,其中模型必须将完整的推理过程表达为图像。我们的评估包括长文本渲染、事实知识探究、上下文理解和多步骤推理。在这些设置中,我们发现当前的 T2I 模型经常产生语义错误、逻辑不一致和不正确的中间步骤,即使渲染的文本在视觉上看起来很清晰。这些失败与纯文本模型在相同任务上的强大推理性能形成鲜明对比。我们的研究结果揭示了视觉文本生成和程序推理之间存在巨大差距,从而激发了更可靠的视觉文本推理。