论文
推理质量很重要:在基于 LLM 的嵌入学习中对抗推理崩溃
Reasoning Quality Matters: Combating Reasoning Collapse in LLM-based Embedding Learning
摘要
大型语言模型 (LLM) 最近显示出在生成用于检索的上下文丰富的文本嵌入方面的强大潜力。大多数现有方法要么将嵌入学习视为被动特征提取,要么通过指令跟踪利用 LLM 推理来实现更好的嵌入优化。然而,对嵌入目标的专门化可能会抑制有用的推理生成或产生与检索无关的文本。我们将这两种形式的退化称为推理崩溃。为了解决这个问题,我们提出了 CoFree(无崩溃推理嵌入),这是一个两阶段框架,可逐步将 LLM 推理集成到查询和文档嵌入优化中,同时保持推理质量。在第一阶段,CoFree应用参考引导的监督微调来恢复基础嵌入模型的推理能力并保留表示强度。在第二阶段,我们引入双重奖励,即面向嵌入的奖励和面向推理的奖励,以保证强化学习中与嵌入目标的相关性的细粒度推理。这种端点耦合优化将嵌入学习从静态对齐转变为高质量的推理引导搜索过程以进行检索。大量实验证明了 CoFree 的有效性,在 MTEB 和 BRIGHT 的 22 个数据集上,CoFree-4B 比 Qwen3-Embedding-4B 平均绝对提高了 2.8 nDCG@10 点。现实世界检索系统中的在线实验进一步显示出一致的增益。代码、RTED 和模型检查点将公开。