论文

超越全球规范:无需再训练即可个性化语言模型中的毒性敏感性

Beyond a Global Norm: Personalizing Toxicity Sensitivity in Language Models Without Retraining

模型评测模型能力评测

摘要

减少毒性通常被视为全球协调问题,但对有害语言的看法是主观的且依赖于上下文。我们首次对 无需训练 方法进行比较评估,该方法用于在三个推理时间干预阶段将语言生成与用户特定的毒性敏感性对齐:解码前(提示调节和重写)、解码中(词元、logits 和表示转向)和解码后(候选重新排序)。根据 PRISM 数据集得出的毒性敏感性目标进行评估,所有方法都将对齐误差减少了 28-47%。然而,结果揭示了对齐有效性、个性化和一般语言质量之间的基本权衡,表明毒性敏感性对齐本质上是一个多目标问题。