论文

HeadRank:通过偏好对齐的注意力头进行无解码的段落重排序

HeadRank: Decoding-Free Passage Reranking via Preference-Aligned Attention Heads

上下文与知识检索增强

摘要

直接从 LLM 注意力权重读取相关性信号的免解码重排序方法比自回归方法具有显着的延迟优势,但会受到注意力分数同质化的影响:中间上下文文档收到几乎相同的分数,破坏了排名所需的细粒度区别。我们提出了 HeadRank,这是一个框架,通过熵正则化头部选择、硬相邻级偏好对和分布正则化器,将偏好优化从离散标记空间提升到连续关注域,共同提高同质化中间区域的可辨别性。最深选定层的深度截断进一步减少了对 $\mathcal{O}(1)$ 前向传递的推断。在三个 Qwen3 尺度 (0.6B--4B) 的 14 个基准测试中,仅使用 211 个训练查询,HeadRank 在每个尺度上都实现了最高的平均 NDCG@10,在大多数基准测试中均优于生成基准和无解码基准,格式化成功率为 100\%。在 4B 处,57.4% 的相关中间区域文档到达顶部四分位数,而不相关文档的这一比例为 14.2%——43 个百分点的选择性差距证明了注意力空间偏好对齐对于列表重新排序的有效性。