论文
用基于DMD的提示-响应嵌入动力学分类保障LLM安全
Enforcing LLM Safety through DMD-based Classification of Prompt-Response Embedding Dynamics
摘要
大语言模型(LLM)越来越多地部署于高风险应用,但其生成有毒、有害或违反政策内容的倾向构成重大风险。以黑盒方式高效检测这些不安全输出仍是开放挑战。本文将最近为幻觉检测提出的动力学系统框架扩展到LLM安全分类。通过将提示与响应投影到高维嵌入空间,并为安全与不安全两种机制分别拟合基于Koopman的预测模型,我们用一种新的差分残差分数对新的输出进行分类,该分数比较安全机制与不安全机制的预测误差。一个关键贡献是纳入提示与响应的嵌入动力学,得到能捕捉关键交互模式的拟合Koopman算子。我们在三个安全基准上、使用三个嵌入模型评估该黑盒方法。结果显示,纳入提示嵌入带来一致改进,特别是与因果解码器配对时对依赖交互的违规(如在Llama-3中);而仅响应的违规更多受益于稠密语义嵌入表示。这些发现为用动力学系统分析AI系统开辟了道路,而不是主流的用AI建模动力学系统的范式。
