论文
铺满真实意图:意图感知训练改进了 LLM 跨训练制度的安全分类
Paved with True Intents: Intent-Aware Training Improves LLM Safety Classification Across Training Regimes
摘要
我们认为安全分类器应该将用户意图建模为提示和最终标签之间的明确信号。为了研究这一点,我们引入了 AIMS,这是一个人工注释的数据集,包含 1,724 个困难的安全提示,每个提示都配有意图描述和危害标签。我们使用 AIMS 来评估监督 微调、偏好学习、推理 蒸馏 和强化学习的意图感知训练。尽管规模很大,但 AIMS 可以在整个训练体系中实现具有竞争力的安全分类器:来自模型生成的意图错误的 DPO 比 SFT 有所改进,并且在大多数师生对中,意图条件 蒸馏 的性能优于仅推理的 蒸馏。最值得注意的是,使用 GRPO 直接奖励意图 忠实性 在五个外部安全基准中产生了最强的平均性能,而我们的意图感知模型形成了推理延迟 F1 帕累托前沿。这些结果表明,忠实的意图建模是一种紧凑的、高质量的监督信号,可以实现更强大的安全分类器。