论文

通过混合弃答与自适应检测提升 LLM 可靠性

Improving LLM Reliability through Hybrid Abstention and Adaptive Detection

模型推理解码与生成控制

摘要

部署在生产环境的大语言模型(LLM)面临根本的安全-效用权衡:严格过滤机制能阻止有害输出,却常拦截良性查询;放宽控制则可能生成不安全内容。基于静态规则或固定置信阈值的传统护栏通常对上下文不敏感且计算昂贵,导致高时延和用户体验下降。为解决这些局限,我们提出自适应弃答系统,基于领域和用户历史等实时上下文信号动态调整安全阈值。所提框架整合了由五个并行检测器组成的多维检测架构,通过层级级联机制结合,兼顾速度与精度。级联设计通过渐进过滤查询减少不必要计算,相比非级联模型和外部护栏系统显著改善时延。在混合与特定领域工作负载上的大量评估表明误报显著减少,在医疗建议和创意写作等敏感领域尤为突出。在严格运行模式下,系统保持高安全精度和近乎完美的召回。总体而言,我们的上下文感知弃答框架在保持性能的同时有效平衡安全与效用,为可靠 LLM 部署提供可扩展方案。

通过混合弃答与自适应检测提升 LLM 可靠性
图6:跨6个模型和8个类别的扩展基准结果。热图(左下)按类别可视化弃答率,柱状图则比较成功率和延迟。该系统在有效拦截有害内容的同时,保持对安全查询的实用性。