论文
硬决策层:Transformer承诺式推理的证据
The Hard Decision Layer: Evidence for Committed Inference in Transformers
摘要
我们研究基于Transformer的语言模型在多选题问答中于何处以及如何对预测做出承诺。我们识别出硬决策层(Hard Decision Layer, HDL),这是一种自然的架构特性:推理过程中答案选项的排序会在某一层突然稳定下来。在四个语言模型(Qwen、Llama、Granite、Mistral)和四个基准数据集上的实证验证表明,HDL的出现是一致的,且不依赖任何习得的路由策略。我们还表明HDL对微调是不变的。我们的结果揭示了HDL处显著的准确率提升:最高达+0.61(Qwen在CommonsenseQA上),此后性能趋于稳定。对标签格式与问题复杂度的系统性消融证实,该现象是模型架构的根本属性。这些发现为Transformer推理提供了机制层面的洞见,并为高效推理与模型调控提示了机会。复现本工作所需的全部代码与结果已在 https://github.com/Mystic-Slice/hard-decision-layer 公开。
