论文

XTC:通过排除最佳选择进行头部感知采样

XTC: Head-Aware Sampling by Excluding Top Choices

模型推理解码与生成控制

摘要

自回归语言模型的标准解码规则通过重新调整完整的下一个词元分布或截断其低概率尾部来促进多样性。这些策略忽视了开放式生成的常见机制,其中几种延续是合理的,但太多的概率质量仍然集中在最通用的选择上。我们引入了 XTC(排除最佳选择),这是一种直接针对这种机制的轻量级头部感知解码运算符。 XTC 识别概率超过绝对合理性阈值 $τ$ 的词元:当至少有两个符合条件时,它会以概率 $ρ$ 删除占主导地位的合格选择,并在重整化之前仅保留最弱的合理选择。通过在 Gemma 3 27B Q4、Gemma 3 12B Q6 和 DeepSeek R1 14B Q6 上进行的 60 次实验,并在 Llama 3.3 70B Q4 上进行缩放验证,XTC 改善了多样性重复帕累托前沿。在创意生成方面,四个模型中的 Distinct-2 增加了 11--15%,重复三元组​​减少了 27--47%。与温度缩放相结合,与基线相比,Distinct-2 的增益达到 38%,重复三元组​​的减少达到 71%。一项针对 150 名大师评分者的 Amazon Mechanical Turk 盲法研究显示,对 XTC 的创造力偏好为 62.3% ($p<10^{-4}$),且流畅度没有降低,而 GPT-4o 控制评判则在每项指标上都重现了人择评判的方向。在使用 Llama 3.3 70B Q4 的 IFEval 上,XTC 将即时级严格精度保持在基线的 1.7 个百分点以内,同时恢复了大部分分集增益; Distinct-2 上匹配的温度设置将 IFEval 降低了 8.8 个点。该效果与温度和重复惩罚相加,在量化级别和模型系列中都很强大,并且在十二种提示类型中保持一致。 XTC 已被 llama.cpp、ExLlamaV2 和 text- Generation-webui 采用。