论文
作为特权角色的助理:跨角色自我识别的规范参考
The Assistant as a Privileged Persona: A canonical reference in cross-persona self-recognition
摘要
经过训练的语言模型可以从上下文中的一两个句子中识别出自己的输出。在配套论文 \citep{jack2026twomodes} 中,我们表明,通过助理模式生成的熵急剧下降,它们还可以识别当前正在执行 同策略 的操作。这两个信号都与 后训练 主要塑造的助理角色相关。本文拓宽了 Llama-3.1-70B-Instruct 上跨人物作者身份判断的框架。我们测量了一组评估者和生成者角色(涵盖图书馆员、龙和莎士比亚)的作者权声明率矩阵,并提出了两个声明。 \emph{首先},在助理自己的矩阵行上,助理的声明率、激活空间中与助理的角色向量距离,以及助理对角色文本的惊讶与角色对自己文本的惊讶之间的熵差距都是紧密耦合的。这将 \emph{acting} 的熵签名从配套论文扩展为 \emph{having acted} 的回顾性签名。 \emph{第二},这种耦合在助手的行中失败了:熵间隙的自然对称扩展并不能预测独特评估者(海盗、龙、莎士比亚)的作者身份;所做的是不对称的——评估者的惊讶与助理对同一文本的惊讶相比,而不是与生成器的惊讶相比。我们排除了任何角色都可以通过尝试许多候选替代品来发挥这种参考作用的替代方案;没有人这样做。我们将不对称性解释为模型对助手执行隐式贝叶斯似然比测试作为规范替代假设,角色向量几何为\citet{chen2025persona}(每个角色与助手相差一个增量)确保助手是唯一可以普遍访问该测试的角色。