论文
超越极化:逐点重排序中思想链的生成约束
Beyond Polarization: The Generative Constraint of Chain-of-Thought in Pointwise Reranking
摘要
在逐点文档重新排名中,思想链模型通常表现不佳直接评分模型。虽然现有的诊断方法将其归因于分类较差、分数两极分化或校准故障,但有针对性的训练是否可以弥补这一差距仍不清楚。我们的实证研究首先证实,这种差距在高达 32B 参数的范围内是稳定的,排除了模型和数据容量的混杂因素。然后,我们利用强化学习、细粒度监督和架构解耦应用压力测试来明确修复这些偏差。尽管这些干预措施提高了分类准确性和绝对分数,但相对排名差距仍然存在。这些发现表明,在逐点评分范式中,通过离散文本路由连续相关语义会限制对信号分辨率进行排名,揭示了在当前标准方法下稳定且难以克服的瓶颈,而不是易于解决的训练偏差。