论文
带有仇恨言论注释的 LLM 对齐的基于属性的诊断
Attribute-Based Diagnosis of LLM Alignment with Hate Speech Annotations
摘要
仇恨言论标注成本高昂、主观性强,并且容易出现标注者的分歧,使得大规模数据集的构建具有挑战性。我们系统地分析了 大语言模型 (LLM) 在十个有理论基础的主观属性(例如非人化、暴力和情感)上与人类判断的一致性,评估了 Llama 3.1 和 Qwen 2.5 的小型和大型变体。我们的分析揭示了所有模型之间的一致分裂:行为明确的维度(侮辱、羞辱、攻击-防御)与人类注释密切相关,而评估维度(尊重、情感、仇恨言论)则系统性地反转。人口特征调节会降低模型的置信度,但不会改善一致性。基于这些见解,我们建议通过置信加权岭回归结合属性级 LLM 预测,以从测量仇恨言论语料库中重建连续的仇恨言论分数,实现高达 0.71 的 $R^2$ 并优于直接提示基线,证明结构化属性分解比单独的端到端标签预测恢复了更丰富、更符合人类的信号。