论文
跨度引导排毒何时有帮助?受控比较中的人类偏好和评估者诊断
When Does Span-Guided Detoxification Help? Human Preferences and Evaluator Diagnostics in a Controlled Comparison
摘要
跨度引导重写旨在通过对带注释的有害跨度进行本地化编辑来保留含义,但同样的约束可能会导致有害意图得不到充分缓解。我们在混合源英语评估集上对跨度引导和非引导戒毒进行了受控探索性比较,该评估集包括手动策划的输入和 HateXplain 测试项目。我们在固定的单发电机设置下进行了密集的盲人评估。人类的偏好揭示了一种权衡,而不是一种一致优越的重写策略。当本地化编辑保留原始立场并避免不必要的修改时,跨度引导输出受到青睐,而当更广泛的重写实现更完全的缓解时,非引导输出受到青睐。这种对比在研究定义的阶层中存在很大差异:两种策略在强阶层中具有竞争力,而无指导重写在温和阶层中显然是首选。基本原理注释将这种差异追溯到互补的失败风险:局部编辑后的残留伤害和更广泛的重写后的过度修改。我们将自动评估视为一种诊断,而不是人类判断的替代品。毒性相似性标化、多生成器分析和两个通用 LLM 判断再现了部分总体趋势,但不会产生类似的分层对比。这些特定于设置的发现并未建立基于严重性的路由规则。相反,它们激发了评估协议,分别评估缓解充分性和意义保存,并报告残余危害和过度修改以及总分。