论文

LLM的在线安全监控

Online Safety Monitoring for LLMs

AI 基础设施可观测性

摘要

尽管经过对齐训练——LLM在部署时仍容易产生不安全输出。因此在线监控输出——当无法再假定安全时发出警报——至关重要。我们研究一种简单的实时监控器:通过阈值化将来自外部模型的验证器信号转变为警报决策——阈值经风险控制校准。在数学推理与红队数据集上的实验中——我们展示这一简单设计与基于序列假设检验的更先进监控器相比具有竞争力。

LLM的在线安全监控:论文配图
图 1:监控数学推理 (MATH) 的真实性:CRC 和 UCB 校准单个阈值,将 PRM 分数转变为警报,但比训练多个密度估计器的电子评估器更早(第三行)检测到错误答案。