论文
单智能体与多智能体生成式AI架构中的语言刻板印象分析
Analysis Of Linguistic Stereotypes in Single and Multi-Agent Generative AI Architectures
摘要
文献中许多工作表明,LLM输出表现出歧视性行为,会根据输入所用的方言触发基于刻板印象的推断。已有研究表明,当相同输入分别以标准美式英语(Standard American English, SAE)和非裔美国人英语(African-American English, AAE)提供给LLM时,这种偏见尤为明显。本文复现了针对LLM输出中方言敏感刻板印象生成的既有分析,并研究缓解策略的效果,包括提示工程(基于角色的提示和思维链(Chain-Of-Thought)提示)以及由生成-批判-修订模型组成的多智能体架构。我们定义了八个提示模板,以分析方言偏见可能表现的不同方式,例如为SAE或AAE说话者建议的姓名、职业和形容词。我们采用LLM-as-judge方法评估结果中的偏见。结果显示,在所有模板类别中,SAE相关输出与AAE相关输出之间都出现了带有刻板印象的差异,其中形容词和职业归属方面的效应最强。基线差异因模型而异、幅度可观:SAE-AAE差值在Claude Haiku上最大,在Phi-4 Mini上最小。思维链提示被证明对Claude Haiku是有效的缓解策略,而使用多智能体架构则确保了在所有模型上的一致缓解。这些发现表明,对于纳入交叉性视角的软件工程而言,公平性评估应包含针对具体模型的缓解策略验证,以及在高影响LLM部署中采用工作流级控制(例如涉及批判模型的多智能体架构)。当前结果具有探索性质且范围有限,但可通过扩大数据集规模并将该流程应用于不同语言或方言来加以扩展和复现。
