论文

IGPO:依据实时商品库存优化无需模型训练的AI搜索策略

Inventory-Grounded Policy-Level Optimization for Training-Free AI Search

上下文与知识上下文工程

摘要

在部署早期,人工智能搜索系统通常在频繁更新的产品目录上运行,因此可用的项目及其属性不能被视为可以用固定提示或策略进行编码的稳定知识。 微调、强化学习和静态提示补丁不太适合:标签稀缺,奖励随库存变化,模型发布成本高昂,提示修复很快就会过时。我们提出了基于库存的策略级优化(IGPO),这是一种用于固定 AI 搜索管道的 无需训练 方法。 IGPO 将策略与环境事实分开:它学习根据运行时清单证据采取行动的策略指南,而不是记住可用的项目。在网上,IGPO 通过探测库存并构建库存画像来为每个查询提供依据,然后将相关的政策指南注入检索和选择提示中。离线、随机执行轨迹按查询进行分组——混合结果组直接产生对比信号,库存引导的探索循环将错过的检索路线与在观察到的库存证据下没有找到匹配支持的情况区分开来。自2026年5月起,IGPO已部署在商业智能辅助AI搜索系统中。对完整 IGPO 处理进行的 14 天在线 A/B 测试显示,相对点击率提升了 3.17%,经审计的不良案例减少了 38.9%。