论文

LLM 生成的自闭症沟通中的算法脆弱性和角色偏见

Algorithmic Fragility and Persona Bias in LLM-Generated Autistic Communication

模型评测模型行为与机制分析

摘要

安全对齐减少了明显有害的输出,但无意中编码了边缘化通信的净化的、神经规范的表示。我们使用双角色重写范例来研究这种编码,促使十个 大语言模型 (LLM) 从自闭症或神经典型角色重写自然发生的自闭症话语。我们发现自闭症人格改写在词汇形式和情感语域方面比神经典型改写差异更大,尽管语义相似。此外,大多数模型将跨角色一代折叠成几乎相同的输出。为了揭示这种生成故障背后的机制,我们引入了多主体定性分析框架。我们的结果表明,系统性输出擦除、刻板幻觉和任务回避元评论是该任务普遍的失败模式,它们通过对齐策略而不是参数规模进行聚类。最后,我们与自闭症人类注释者的有针对性的比较表明,社区内部知识会产生相对于 LLM 分类的系统标签反转。我们的研究结果表明,当前的对齐训练会导致特定角色的生成故障,只有通过定性分析才能看到,这证实了提示工程无法解决的深层代表性差距。