论文

编织视觉叙事:超越原子视觉匹配的代理图像束组合

Weaving Visual Narratives: Agentic Image Bundle Composition Beyond Atomic Visual Matching

智能体系统Agent 规划

摘要

图像检索传统上被表述为逐点匹配问题,其中每个候选图像被单独评分。然而,这种原子范式无法捕捉个人照片集中人类搜索意图的复杂性,用户经常寻找受结构关系约束的紧凑视觉故事,而不是孤立的快照。为了解决这个限制,我们引入了**图像包合成(IBC)**,这是一种新颖的范式,它将目标从对单个图像进行排名转变为从大量非结构化照片池中动态合成有凝聚力的图像包。由于目标束不是预定义的,IBC 提出了严峻的组合爆炸挑战,并且需要对不可分解的联合相关性进行建模。为了建立这个范例,我们构建了 **IBCBench**,这是第一个 IBC 基准数据集,包含 109,467 个图像和 667 个经过验证的查询,通过半自动验证管道构建。此外,我们提出 **BundleWeaver**,一个代理框架,它将 IBC 重新表述为查询条件增量超边缘发现。通过使用 大语言模型 自适应地搜索缺失的关系角色并利用视觉语言模型进行全包验证,BundleWeaver 可以有效地导航组合空间。大量实验表明,虽然最先进的嵌入模型和静态分解和重新排序范式遭受关系盲目性,但 BundleWeaver 实现了显着的性能提升,凸显了从原子评分转向动态关系组合的必要性。我们的数据集和代码可用。