论文

OSCAR:面向组合图像检索的优化引导Agentic规划

OSCAR: Optimization-Steered Agentic Planning for Composed Image Retrieval

智能体系统Agent 规划

摘要

组合图像检索(CIR)需要对异构的视觉与文本约束进行复杂推理。现有方法大体分为两类范式:统一嵌入检索,受单模型短视之苦;以及启发式agentic检索,受限于次优的试错式编排。为此,我们提出OSCAR,一个面向组合图像检索的优化引导agentic规划框架。我们首次把agentic CIR从启发式搜索过程重构为有原则的轨迹优化问题。OSCAR不依赖启发式试错探索,而是采用新颖的离线-在线范式。在离线阶段,我们通过原子检索选择与组合把CIR建模为两阶段混合整数规划问题,并借助严格的布尔集合运算,以数学方式推导出最大化训练样本真值覆盖的最优轨迹。这些轨迹随后被存入高质量轨迹库,作为上下文示例在在线推理时引导VLM规划器。在三个公开基准与一个私有工业基准上的大量实验表明,OSCAR持续优于SOTA基线。值得注意的是,它仅用10%的训练数据便取得更优性能,展示了规划逻辑的强泛化而非对特定数据集的记忆。

OSCAR:面向组合图像检索的优化引导Agentic规划
图2:我们提出的OSCAR的总体框架。