论文

硬决策层:Transformer承诺式推理的证据

The Hard Decision Layer: Evidence for Committed Inference in Transformers

模型评测模型行为与机制分析

摘要

我们研究基于Transformer的语言模型在多选题问答中于何处以及如何对预测做出承诺。我们识别出硬决策层(Hard Decision Layer, HDL),这是一种自然的架构特性:推理过程中答案选项的排序会在某一层突然稳定下来。在四个语言模型(Qwen、Llama、Granite、Mistral)和四个基准数据集上的实证验证表明,HDL的出现是一致的,且不依赖任何习得的路由策略。我们还表明HDL对微调是不变的。我们的结果揭示了HDL处显著的准确率提升:最高达+0.61(Qwen在CommonsenseQA上),此后性能趋于稳定。对标签格式与问题复杂度的系统性消融证实,该现象是模型架构的根本属性。这些发现为Transformer推理提供了机制层面的洞见,并为高效推理与模型调控提示了机会。复现本工作所需的全部代码与结果已在 https://github.com/Mystic-Slice/hard-decision-layer 公开。

硬决策层:Transformer承诺式推理的证据:论文配图
图 1:Qwen 模型变压器层中答案选项标记的平均标记排名。每条线代表四个答案选项之一,并在每一层计算 QASC 数据集中所有问题的平均排名。每条排名线周围的褪色区域表示整个数据集排名的标准偏差。根据我们的定义,硬决策层 (HDL) 位于第 25 层。在该层之后,平均排名一直稳定到最后一层。