论文
智能体安全误报审计的正未学习
Positive-Unlabeled Learning for Agent Safety False Alarm Auditing
摘要
安全监视器保护与外部工具和环境交互的语言模型智能体,但保守监控会产生大量误报,消耗审查资源并削弱对告警的信任。由于真假告警在原生监视器分数中常交织,获得可靠截止仍需大量人工验证。实践中可能有一小批验证为安全的未告警轨迹可用而告警无标签——这自然把误报审计构成正未学习(PU)排序问题。关键挑战是监视器诱导的选择:观察到的安全参照被监视器接受,而感兴趣的隐藏安全告警恰是被其错误标记者,使观察到的正类对要恢复的正类代表性差。为此我们提出两阶段框架:信任感知PU监督把安全参照适配向告警域并保护合理误报免受过度负压;可靠性门控排序蒸馏把多个PU参照模型的一致排序偏好合并为单一学生;共识引导结构细化再以分层安全参照支持、告警关系与预测参照共识改进学生排序。框架拟合无需告警安全标签且不改动底层监视器。跨主流安全监视器,本方法宏AUPRC达0.6444,较八个受评PU基线高5.27-16.98个绝对百分点;与最强基线PULDA相比,在5%审查预算下多找回33.3%的误报。