论文
STORM:带有奖励引导束搜索的逐步词元优化
STORM: Stepwise Token Optimization with Reward-Guided Beam Search
摘要
现代检索越来越依赖于密集和学习稀疏的神经模型,这些模型是有效的,但需要将整个语料库编码成专门的索引,并在模型发生变化时重建。像 BM25 这样的词法 检索器 在标准倒排索引上保持高效和透明,不需要随着模型的发展而改变,但会遭受词汇不匹配的影响。 LLM 查询重写可以提供帮助,但提示重写器会发出格式良好但检索无效或有害的术语,并且针对检索奖励的训练仅提供延迟的序列级监督,从而掩盖了哪些术语有帮助。我们引入了 STORM(带有奖励引导光束搜索的逐步词元优化),这是一个用于词法查询扩展的自监督框架。 STORM 通过检索指标指导的生成过程来训练重写器:在每一步,候选扩展都会根据 BM25 索引进行评分,并修剪低奖励延续,将检索奖励转化为 词元级 信号,集中探索检索有效的词汇。在 TREC DL 和 BEIR 中,STORM 让 0.6B-8B 主干网匹配或超过竞争性 LLM 重写器,同时检索速度与普通 BM25 一样快;在 8B 上,它可以与更大的专有重写器相媲美。它进一步将零样本迁移到 18 种语言 (MIRACL),平均击败专用多语言密集 检索器,使 STORM 成为密集神经检索的有竞争力的、基础设施轻的替代方案。