论文

用于文本到图像上下文学习的思想树推理

Tree-of-Thoughts Reasoning for Text-to-Image In-Context Learning

模型推理推理搜索与路径规划

摘要

在文本到图像上下文学习(T2I-ICL)中,模型必须从少量演示中推断出潜在的构图模式,以生成查询图像。最近的研究表明,最先进的多模态 大语言模型 难以适应这种设置,特别是由于有限的组合推理和对提示构造的敏感性。在这项工作中,我们为 T2I-ICL 提出了一个思想树 (ToT) 推理框架,该框架引入了一个多阶段推理和选择层,该层在构建图像合成的最终提示之前生成、评估和选择多个候选假设。通过探索替代推理分支并选择连贯的解释,所提出的方法减轻了提示歧义和构图错误。我们在完整的 ToT-T2IICL 推理管道中实现了所提出的方法,并在 CoBSAT 基准上对其进行了评估。定性和定量结果都表明,与基线和思想链提示策略相比,结构化多分支推理可以生成更加一致和语义一致的图像,而无需任何额外的训练或 微调。