论文LLM的在线安全监控Online Safety Monitoring for LLMsMona Schirmer; Metod Jazbec; Alexander Timans; Christian Naesseth; Maja Waldron; Eric Nalisnick·来源日期:2026.07.03AI 基础设施可观测性收藏摘要原文译文尽管经过对齐训练——LLM在部署时仍容易产生不安全输出。因此在线监控输出——当无法再假定安全时发出警报——至关重要。我们研究一种简单的实时监控器:通过阈值化将来自外部模型的验证器信号转变为警报决策——阈值经风险控制校准。在数学推理与红队数据集上的实验中——我们展示这一简单设计与基于序列假设检验的更先进监控器相比具有竞争力。图 1:监控数学推理 (MATH) 的真实性:CRC 和 UCB 校准单个阈值,将 PRM 分数转变为警报,但比训练多个密度估计器的电子评估器更早(第三行)检测到错误答案。