论文

用基于DMD的提示-响应嵌入动力学分类保障LLM安全

Enforcing LLM Safety through DMD-based Classification of Prompt-Response Embedding Dynamics

模型评测安全与风险评测

摘要

大语言模型(LLM)越来越多地部署于高风险应用,但其生成有毒、有害或违反政策内容的倾向构成重大风险。以黑盒方式高效检测这些不安全输出仍是开放挑战。本文将最近为幻觉检测提出的动力学系统框架扩展到LLM安全分类。通过将提示与响应投影到高维嵌入空间,并为安全与不安全两种机制分别拟合基于Koopman的预测模型,我们用一种新的差分残差分数对新的输出进行分类,该分数比较安全机制与不安全机制的预测误差。一个关键贡献是纳入提示与响应的嵌入动力学,得到能捕捉关键交互模式的拟合Koopman算子。我们在三个安全基准上、使用三个嵌入模型评估该黑盒方法。结果显示,纳入提示嵌入带来一致改进,特别是与因果解码器配对时对依赖交互的违规(如在Llama-3中);而仅响应的违规更多受益于稠密语义嵌入表示。这些发现为用动力学系统分析AI系统开辟了道路,而不是主流的用AI建模动力学系统的范式。

用基于DMD的提示-响应嵌入动力学分类保障LLM安全:论文配图
((a)) 先前工作:多个响应((b)) 近期工作:单个响应的token动力学。图1:分析LLM响应性质的两种途径:(a)通过改变softmax温度参数为同一查询获得多个响应;(b)通过嵌入模型获得单一响应的token嵌入动力学。