论文
Top-$K$ 审查 API 访问下分布模型提取的识别集几何
Identified-Set Geometry of Distributional Model Extraction under Top-$K$ Censored API Access
摘要
现代 LLM API 通常仅显示 top-$K$ logits 分数并审查其余词汇。我们研究了这种访问模型的每个位置的分配恢复限制。对于审查阈值 $τ$,兼容的教师分布形成一个确定集,其总变异直径恰好为 $U_K=(V-K)\exp(τ)/(Z_A+(V-K)\exp(τ))$,其中 $Z_A$ 是观察到的配分函数。对于 KL 恢复,我们给出了可计算的二进制端点下界和渐近匹配的小模糊度上限,并扩展到参考感知攻击者。对 Qwen3 数学推理老师的实验揭示了分层提取层次结构:任务顶部 $K$ 蒸馏 恢复了 12% 的私有能力,完整的 logits 蒸馏 尽管 KL 闭合率为 99%,但恢复了 56%,基于生成的提取恢复了 96%。因此,Top-$K$ 审查限制了每个位置的分布恢复,但其本身并不能阻止能力提取,从而将保真度与仅提示 logits 蒸馏 中的传输分开。