论文

无名标记化:开放权重大语言模型中针对控制词元伪造的无损标记器级防御

Nameless Tokenization: A Lossless Tokenizer-Level Defense Against Control-Token Forgery in Open-Weight LLMs

上下文与知识上下文工程

摘要

开放权重语言模型发布其聊天模板用于标记回合、角色和工具结果的字符串,标记器将其映射回模型遵循的保留标识符。因此,任何控制提示中文本的人都可以编写与服务堆栈编写的回合边界没有区别的回合边界。我们审核了 256 个已部署的聊天标记器。所有这些都是可伪造的,并且通常建议作为修复的标志留下 56.6% 可伪造,因为它缺少代理系统所依赖的工具和推理标记。我们提出无名标记化,它为控制条目留下保留的标识符,并且没有表面字符串,因此内容编码器无法发出标识符,并且消息内容到达模型时不会发生改变。在五个标记器系列中,它可以准确地在无攻击数据上重现标准标记流,并将带有分隔符的文本探测的准确性从 8.5% 提高到 59.9%,而清理程序会丢失它。将定界符的外观与其标识符分开表明,标识符对于裸任务指令影响不大,但一旦系统消息告诉模型将用户内容视为数据,就会携带大部分伪造的工具结果和大部分伪造的转弯。