论文

通过对话式搜索的语料库反馈学习多步查询重写

Learning Multi-Step Query Rewriting via Corpus Feedback for Conversational Search

模型训练上下文与知识应用与实践强化学习检索增强搜索

摘要

会话查询重写 (CQR) 将上下文相关的用户转换为检索器的独立查询,并且大多数方法在检索一次之前从对话历史记录中一步完成此操作。因此,在任何语料库证据可用于纠正其参考解析或其词汇之前,重写就已确定。我们将 CQR 重新定义为一个顺序检索问题:代理重写当前回合、检索并根据返回的段落条件进行下一次重写。该代理在三个重写操作的类型空间中进行操作,将会话意图解析为独立查询,生成词汇重新表述,或合成用于文档到文档匹配的伪文档,以及结束该情节的停止操作。我们通过监督微调来训练策略,然后针对单个检索质量奖励进行强化学习,不使用人工重写注释。在 TopiOCQA 和 QReCC 中,该代理优于多个检索对齐的基线,同时在检索后端保持有效并推广到 CAsT 基准 无需额外培训。进一步的分析表明,仅通过检索奖励优化,学习策略就形成了一种将伪文档嵌入到早期步骤检索的段落中的行为,从而大大提高了检索能力。