论文

当通证化暗中输出监管

When Tokenization is Secretly Output Supervision

模型评测模型行为与机制分析

摘要

默认情况下,语言模型中的标记化被视为输入预处理决策。我们认为这种框架是不完整的:在自回归模型中,分词器粒度决定了模型在单个前向传递中必须解决的问题,从而决定了它接收的监督信号。这会影响学习问题的难度和模型内部出现的表示。我们通过输入和输出标记化的新颖解耦,在数字推理的受控实验中对此进行了测试。正如输出监督视图所预测的那样,任务性能、训练动态和模型内部的差异是由输出标记化引起的,并且在很大程度上与输入标记化无关。这在实践中可能很重要,因为具有不同标记化策略的模型不仅在输入表示上不同,而且在它们所训练的任务上也不同。因此,模型之间的比较可能部分反映任务定义而不是能力。对最近 120 篇关于数字推理的 *CL 论文进行的调查证实,这一点很少得到承认:只有约 10% 的论文报告了他们评估的模型的数字标记化,而 69% 的论文对标记化和监督制度进行了比较,但没有报告。虽然之前的工作证明标记化持续影响模型性能,但没有原则性地解释原因。我们认为,将代币化框架作为输出监督提供了这种解释。