论文

重复 token 的去向揭示模型家族信号

Where a Model Sends Its Own Repeated Token

模型评测模型行为与机制分析

摘要

黑盒模型识别通常依据模型对自然语言提示的响应评分。有一类工作向模型输入重复的自身token,以寻找失效模式。本文沿用该输入,研究模型不继续重复时会转向何处。对每个token t,以一次前向传播读取argmax p(. | t,t),得到覆盖整个词表的映射。第一部分是哪些token为不动点。作者将其报告为失败的待估量:其自然距离有83%由集合基数决定,对一次语料操作的区分仅为3471位中的两位且精度下限为零,模型家族归属准确率为0.5833。第二部分研究非不动点token被映射到哪里;此前唯一保存这些token的论文把它们记为零。按源token配对可从构造上消除基数混杂,相关系数从0.9128降至-0.0932;在7个分词器组和多个语料库上,以19个模型为候选池评估12个模型,家族归属准确率为0.8333,随机水平为0.1389。两个零假设对照的一致率分别为频率匹配目的token的0.1429和独立边缘分布的0.0798。家族比tokenizer更能预测一致性(0.2031对0.1205);循环架构聚类的平衡准确率为1.0,多数类比例为0.7895,排除每个模型最主要的目的token后仍为0.90,作者以后一数字为支持结论。稳健性实验显示,在一个支持集上,8位权重舍入改变映射的幅度小于训练语料去重(0.9004对0.6353),4位量化则破坏该信号(0.0098;在部署粒度为0.1812,因此并非粒度过粗的伪影)。精度下限因模型而异,为0.201至0.9778。所有待估量及否决条件均在观察数据前登记,失败结果与保留结果同样完整报告。