论文

FLIPS:通过伪随机序列对 LLM 进行实例指纹识别

FLIPS: Instance-Fingerprinting for LLMs via Pseudo-random Sequences

AI 基础设施AI安全与内容治理基础设施

摘要

文献表明,大语言模型 (LLM) 的行为不仅取决于其原始权重,还取决于其实例级参数,例如指令提示、采样配置或量化。在一种配置下生成安全输出的模型可能在另一种配置下产生有毒内容。然而,当前的LLM识别技术(例如指纹识别)侧重于知识产权保护,其设计有利于这些实例级参数变化的鲁棒性。这对人工智能监管提出了严峻的挑战,其中合规性评估针对的是实际部署的行为,而不是模型的来源。在本文中,我们介绍了实例级指纹识别,这是一种面向监管者的范式,可区分相同 LLM 的配置。我们的方法 FLIPS 利用生成的二进制随机序列中的偏差,在 237 个模型实例中达到 96%(封闭集)和 90%(开放集,其中一些目标未知)的识别准确度,而改编后的 LLMmap 基线的识别准确度为 35%。这表明实例级指纹识别对于监管来说既是必要的,也是实际可行的。代码可在 https://github.com/GurvanR/FLIPS-LLM-Instance-Fingerprinting 获取。