论文

presto:通过想象搜索实现高效、无需训练 和开放世界对象放置

presto: Efficient, Training-free, and Open-world Object Placement via Imaginary Search

模型推理推理搜索与路径规划

摘要

对象放置在图像合成中至关重要,需要在不同场景中对对象进行空间和语义上的连贯定位。现有的方法通常依赖于手工制定的规则或对有限数据集的监督学习,这限制了它们的泛化性和可解释性,特别是在涉及新物体和场景的开放世界场景中。在这项工作中,我们将开放世界对象放置重新表述为由多模态 大语言模型 (MLLM) 推理引导的启发式搜索任务。我们引入了 \textsf{presto},一个零样本的 无需训练 框架,它在想象的动作空间中运行,以迭代地细化对象位置和比例。我们从粗到细的搜索策略确保快速收敛,并且我们评估两种决策变体:度量引导选择和 MLLM 作为判断。跨多个基准的实验表明 \textsf{presto}~ 实现了最先进的性能,特别是在以前未见过的开放世界设置中。人类研究进一步表明,MLLM 作为法官的变体比度量驱动的方法产生更多感知上连贯的位置,凸显了标准评估指标和人类视觉判断之间的差距。