论文
多轮 LLM 系统的状态护栏:对话式风险累积框架
Stateful Guardrails for Multi-Turn LLM Systems: A Conversational Risk Accumulation Framework
摘要
大语言模型 (LLM) 的大多数安全护栏都会单独评估每个提示响应对,从而错过仅在对话中出现的故障,因为良性转变为危害。我们将这种现象称为“对话风险累积”(CRA):逐渐的意图漂移、禁止指令的零散组装以及重复披露导致的敏感性积累。我们提出了一个会话层 CRA 框架,该框架跟踪三个轨迹信号:会话锚点的语义漂移、提取实体上的敏感度加权信息累积图,以及捕获不断增加的遵守意愿的服从梯度信号。对于评分,我们提供(i)用于归因和消融的无监督凸融合,以及(ii)CRA-Net DA,这是一种紧凑的学习轨迹模型,通过家庭对抗目标进行训练,以减少长度和主题覆盖混淆。为了对 CRA 进行基准测试,我们发布了 CRA-Bench v0.1(跨三个威胁系列的 1,200 个八回合会话,具有主题匹配的良性双胞胎)、CRA-Bench v0.2(LLM 释义变体,以减少模板工件)和扩展的 5 系列集(2,000 个会话,添加角色启动和上下文填充)。我们引入了一种轨迹本机评估协议,具有会话级分割、混合集阈值校准、轨迹 AUROC、转向检测、校准假阳性指标、引导置信区间、留一族诊断压力测试和合成到人类转移检查。索赔重点是 CRA-Bench 和人员转移子集上的分配内会话评分。