论文
具有限制性 API 访问的 LLM 架构属性的黑盒推理
Black-Box Inference of LLM Architectural Properties with Restrictive API Access
摘要
实际上,大多数商业 LLM 提供商不会公开发布底层 LLM 架构的详细信息。然而,先前的工作表明,给定对 LLM 的有限 API 访问(即 top-$k$ logits 和/或 logits 偏差函数),人们可以恢复 LLM 的某些架构细节,例如前馈网络的隐藏维度。也许为了响应这些结果,大多数商业 LLM 提供商已将其 API 限制为仅公开每个解码令牌的单个 logits,并且他们不再向用户提供偏置 logits 的能力。我们表明,即使在当前的限制性 API 下,一些架构参数仍然是可以恢复的。我们提出了 NightVision,这是一种使用限制性黑盒 API 访问来估计 LLM 的隐藏维度、深度和参数计数的攻击。在算法上,NightVision 依赖于一种新颖的通用集提示技术,其中多个提示公开同一组输出标记的对数概率;这些结果的频谱分析用于推断隐藏维度。 NightVision 此外还使用端到端首次标记时间 (TTFT) 测量和估计的隐藏维度来估计深度和参数计数。我们在 32 个开源 LLM 上对 NightVision 进行了实证评估,将所有模型的隐藏维度平均相对误差恢复到 23% 以内(MoE 模型为 9%),对于超过 30 亿参数的模型,深度和参数计数恢复到 53% 以内。我们进行了广泛的消融,以演示这些精度如何随 词元预算 和模型属性变化。总的来说,我们的结果表明当前的 LLM API 没有受到足够的限制,无法完全混淆其底层模型的架构细节。