论文

预测黑盒多轮交互中的轨迹级安全风险

Forecasting Trajectory-Level Safety Risks in Black-Box Multi-Turn Interactions

AI 基础设施AI安全与内容治理基础设施

摘要

随着 大语言模型 (LLM) 从独立助手演变为自主代理,确保其安全需要超越逐点风险评估,以了解风险如何在长期轨迹上出现和展开。在多回合交互中,恶意意图可以在看似无害的回合中分解,并通过交互轨迹逐渐重建,最终导致安全失败。现有的保障措施在很大程度上仍然是被动的,检测明显的违规行为,但缺乏预测潜在风险演变和实现先发制人预防的能力。为了解决这一限制,我们提出了 Recast,这是一种安全风险预测框架,可将 LLM 防护从回合级违规检测提升到轨迹级风险预测。 Recast 首先通过双尺度轨迹视图从短期对话进展和长期历史背景中检索风险相关证据。然后,它通过捕获当前风险配置及其时间动态来对成分风险演变进行建模。最后,因果时间编码器学习潜在风险演化模式并预测未来风险出现轮次的分布。涵盖 7 个风险类别的广泛实验表明,Recast 可以预测 88.3% 的未来安全故障,平均提前时间为 2.41 圈,同时保持 12.3% 的误报率,展示了轨迹级预测在安全违规发生之前识别新兴风险的有效性。