论文
推理模型能增强嵌入模型吗?
Do Reasoning Models Enhance Embedding Models?
摘要
最先进的嵌入模型越来越多地源自经对比学习适配的decoder-only大语言模型(LLM)骨干。鉴于通过可验证奖励强化学习(RLVR)训练的推理模型兴起,一个自然的问题浮现:当这些模型作为嵌入初始化时,增强的推理是否会转化为更优的语义表示?与预期相反,我们在MTEB和BRIGHT上的评估揭示了零效应:在相同训练配方下,由RLVR调优骨干初始化的嵌入模型相较其基座对应模型没有一致的性能优势。为解开这一悖论,我们提出分层表示相似性分析(HRSA),一个跨表示、几何和函数层面分解相似性的框架。HRSA揭示,虽然RLVR引发不可逆的潜在流形局部几何重组和可逆的坐标基漂移,但它保留了全局流形几何和线性读出。因此,后续的对比学习驱动基座初始化与推理初始化模型之间形成强对齐,我们将这一现象称为流形再对齐。实证上,我们的发现表明,与监督微调(SFT)不同,RLVR在现有语义景观内优化轨迹,而非从根本上重构景观本身。
