论文

ARBITER:LLM护栏的双假设推理框架

A Dual-Hypothesis Reasoning Framework for LLM Guardrails

模型推理推理策略与问题分解

摘要

我们提出ARBITER,一个新颖的LLM护栏框架,引入两个关键思想:(i)双假设推理——一种LLM护栏的推理方法,在做出安全决策前显式考虑提示的安全与不安全两种解读;(ii)多组件监督微调(MC-SFT)——面向推理型护栏的结构化训练损失,把LLM输出分解为逻辑组件并按重要性加权。现有推理型护栏常依赖昂贵流程:用更大或闭源教师模型生成推理轨迹并做全参数微调。相比之下,ARBITER以成本划算的自生成策略产出推理轨迹,配合LoRA参数高效微调,仍取得比这些昂贵方法更好的表现。此外,ARBITER为不安全决策提供忠实的证据短语解释,使护栏方法更透明、可解释。在三个安全审核基准上的实验显示,ARBITER优于现有推理型与非推理型护栏基线,在域外评估中增益明显。

ARBITER:LLM护栏的双假设推理框架:论文配图
图 1:仲裁器的输入和输出示例。根据用户提示,护栏会返回带有安全标签和解释的结构化 JSON 决策。