论文

用于长式推理的自适应核截断

Adaptive Nucleus Truncation for Long-Form Reasoning

模型推理解码与生成控制

摘要

采样在长格式语言模型推理中起着重要作用。经过数千个解码步骤,候选标记集的微小变化可以组合成不同的推理轨迹、稳定性概况和最终答案。现有的截断方法(例如 top-$p$、min-$p$ 和固定 top-$nσ$ 采样)比无限制采样有所改进,但它们依赖于固定阈值,无法适应熵、任务难度、训练阶段或生成预算的变化。我们引入了自适应核截断采样(ANTS),它将顶部\(nσ\)采样从固定解码规则扩展到用于长格式生成的自适应转出控制机制。 ANTS 在温度缩放之前选择最大 logits 周围的标准化邻域,使用熵调节控制器调整截断宽度,并保留无截断后备臂以在截断变得不安全时稳定训练。在 33B 总计 / 4B 活跃稀疏专家混合推理模型上,ANTS 在 8K、16K 和 32K 生成预算下将平均性能比基于百分比的基准分别提高了 +1.9、+3.8 和 +5.2 个点。最大的进步出现在指令跟踪和数学推理方面,IFBench 在 32K 上提高了 10 多点,AIME 2025 提高了 7 点。代码生成揭示了重要的预算交互作用。在 Codeforces 上,ANTS 在 8K 时落后于基线,但扭转了这一差距并大幅提高了 16K 和 32K 时的 ELO。这些结果表明,采样器设计不应仅仅被视为解码超参数,而应被视为我们如何稳定和扩展长期预算推理的一部分。