论文
READER:来自查询变化交互的动态LLM溯源
READER: Dynamic LLM Provenance from Query-Varying Interactions
摘要
现有的黑盒大语言模型起源方法通过使用相同的诊断提示查询每个候选模型来实现可比性。在部署中,审计员继承不同的证据流:增量到达的异构提示响应跟踪。我们将动态黑盒大语言模型起源正式化:在注册固定候选生态系统后,在任何可用的证据预算下归因于查询变化的交互。 READER 通过冻结的代理 LLM 恢复可比性。它将与响应标记对齐的代理状态投影到长度归一化 DC 和第一 AC 模式上,捕获响应范围的激活位置和粗轨迹演化。经过注册训练的线性探针将每个指纹转换为源证据,贝叶斯累积重复使用该证据单元,从一个观察到多个观察。我们引入了 Agent500,其中包含来自 100 个本地和 API 源对 500 个异构代理提示的 50,000 个响应。在 100 向归因中,READER 从一个响应中达到 $50.4\%$ 准确度,从 100 个响应中达到 $96.2\%$ 准确度,而最强动态基线的准确度为 $33.0\%$ 和 $79.0\%$。四个不同的代理家族在后一个预算中都超过了 94.8\%$。受控响应长度和 Math100 域移位暴露了零再训练迁移的局限性。成分分析揭示了任务相关的光谱劳动分工:DC 主导动态源身份,而第一个 AC 主导静态关系证据。他们的联合指纹为这两项任务提供了共享的测量空间。 READER 审核观察到的文本,无需目标内部结构或仅审核查询。代码和数据可在 https://github.com/LeoJeshua/READER 获取。
