论文
PL-Guard:LLM Guardrails 的概率逻辑推理
PL-Guard: Probabilistic Logic Reasoning for LLM Guardrails
摘要
大语言模型 护栏可以被视为策略一致性问题:系统必须确定即时响应对中包含哪些与策略相关的事实,以及这些事实在给定策略下意味着什么。常见的方法,包括策略提示和 LLM 作为法官管道,通常与语义基础和策略推理的任务重叠:该模型既解释提示响应对,又解释策略是否被违反的原因。这可能会导致不安全地遵守有害提示,或拒绝协助良性提示。为了区分语义与规则谓词对齐和推理角色,我们提出了 PL-Guard,一种神经符号护栏架构。使用由谓词和 ProbLog 规则组成的符号策略接口,本地 LLM 使用重新规范化的 True/False 标记分数将提示响应对基于谓词概率,而 ProbLog 对符号策略执行显式概率规则推理。在 XSTest 基准测试中,基于 Qwen 的离线评估程序发现,具有手工策划策略的 PL-Guard 将基本模型的不安全合规性从 22.0% 降低到 0.5%,并且低于 LLM 作为法官基线的 6.0% 率。这是以比 LLM 作为法官基线更高的过度拒绝为代价的,分别为 14.4% 和 5.2%。这些结果表明,将神经基础与概率符号推理分开可以揭示安全性与有用性的权衡,同时使护栏的中间推理步骤明确且可审计。