论文
范围:LLM 服务中可靠的 OOD 拒绝的顺序共形探测
SCOPE: Sequential Conformal Probing for Reliable OOD Rejection in LLM Services
摘要
拒绝定义的分发内 (IND) 服务范围之外的输入对于 大语言模型 (LLM) 服务至关重要,其中应在完全生成之前过滤不支持的请求。现有的分布外(OOD)检测器通常依赖于最终输出或最终层表示,从而不清楚服务边界信号在模型内的编码最清晰的位置;他们还缺乏对保留投入的理论保证。在本文中,我们介绍了 SCOPE(顺序共形 OOD 探测和评估),这是一个框架,选择可读的隐藏层,构建具有 IND 校准的共形门,并使用超鞅电子流程来证明持久的服务边界证据。跨多个 LLM 主干和六个精心设计的边界条件的实验表明,SCOPE 比标准最终层检测器提高了门级抑制,同时揭示了不同的 OOD 边界如何在隐藏空间中采取不同的几何形式。