论文

审计匿名人工智能模型:黑盒身份验证的四阶段协议

Auditing Anonymous AI Models: A Four-Stage Protocol for Black-Box Identity Verification

模型评测评测方法与指标

摘要

2025--2026年人工智能市场出现了一波秘密发布浪潮:前沿模型以代号在开发者平台上匿名发布。对于用户来说,身份决定了数据处理条款、供应链风险和能力期望。匿名模型的黑盒身份验证不存在经过验证的方法:从业者清单缺乏准确性证据,并且自我识别在设计上是不可信的。我们为 API 服务的模型提出了一个四阶段取证审计协议。第 0 阶段从存档平台快照(Internet Archive)重建启动时配置,暴露预览-生产偏差。第一阶段针对平台目录的指纹配置(上下文、输出上限、推理、模式)。第 2 阶段使用拒绝短提示冲突的跨长度差异来测试标记器身份。第三阶段通过行为探测得到证实。我们测试了 10 个已知身份发布的声明一致性(7 个准确、2 个精度差异、1 个部分、0 个反向),而不是匿名下的端到端识别。对一个旗舰案例进行了前瞻性验证,该案例的 2026 年 8 月 23 日分析指向 GLM-5.3 版本线,其官方披露证实了这些家族和版本线推论(部署变体未预先断言;Flash 在披露后保持一致),以及三个仅阶段 0 的案例,其中协议产生了分级假设或拒绝而不是猜测。仅标准库的实现作为补充材料提供。