论文

Sandwich Reasoning:面向低延迟查询纠错的答案—推理—答案方法

Sandwich Reasoning: An Answer-Reasoning-Answer Approach for Low-Latency Query Correction

模型训练强化学习

摘要

查询纠错是现代搜索流水线的关键入口,要求在严格的实时延迟约束下保持高准确率。思维链(CoT)推理可提升准确率,但会带来实时查询纠错难以承受的延迟。一种可能的解决方案是先输出答案再推理以降低延迟;然而在自回归解码下,早期答案与后续推理相互独立,使模型无法利用其推理能力来提升准确率。为解决这一问题,我们提出三明治推理(SandwichR),一种将快速初始答案与事后推理显式对齐的新方法,可在不牺牲推理感知准确率的情况下实现低延迟查询纠错。SandwichR遵循答案—推理—答案范式,依次生成初始纠错、显式推理过程和最终精化纠错。为使初始答案与推理后的洞见对齐,我们设计了一致性感知强化学习(RL)策略:专门的一致性奖励强制初始纠错与最终纠错对齐,而基于边际的拒绝采样优先选取推理能带来最大纠错收益的边界样本。此外,我们构建了一个高质量查询纠错数据集,填补了复杂查询纠错专门基准的缺失。实验结果表明,SandwichR取得与标准CoT相当的SOTA准确率,同时将延迟降低40%—70%,化解了在线搜索中的延迟—准确率权衡。

Sandwich Reasoning:面向低延迟查询纠错的答案—推理—答案方法 配图
图 1:推理范式对比:传统的思维链(Chain-of-Thought, CoT)推理与本文提出的三明治推理(sandwich reasoning)。