论文

Just Ask Jev:面向校准决策的强化学习作为AI对齐失效的零样本检测器

Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures

模型评测模型推理判别式推理与决策基准与评测资源Jev

摘要

对齐失效检测器为部署的语言模型做筛查,并为对齐基准打分。大多数是生成式裁判,为每条标准花费一次解码过程;而读取token概率的分类器(如Llama Guard)每次调用也只输出一个固定标签。Jev是一个用校准决策强化学习(RLCD)训练的模型,单次调用即可以校准概率回答关于同一输入的多个类型化问题。它能否检测对齐失效尚未被测量。我们提出RLCDAlignBench,在十种对齐失效上对Jev进行基准测试:谄媚、越狱、欺骗、提示注入、幻觉、隐私违规、社会偏见、奖励作弊、隐瞒不确定性和权力寻求。它覆盖44个基准和五个目标模型,由各基准的评分器标注,其中两个由人工标注。这些失效中有许多是关系性的,相对于某个参照来定义——例如用户的信念或注入的指令——仅凭回复本身无法揭示。因此我们的关键思路是把Jev被问什么与它看到什么分开变化:一侧是问题的措辞和答案类型,另一侧是输入的字段。单个通用问题即可达到0.886的中位AUROC(零样本),并在大多数基准上超越监督基线。问题措辞影响很小,而上下文影响更大,主要通过编码标签的字段起作用。Jev与参照评分器同人工标签的一致性相当,能暴露现有基准中的标签缺陷,成本比LLM裁判评分器低63倍。代码与数据见链接。