论文
审计生成解释中的立场不对称
Auditing Stance Asymmetry in Generative Explanations
摘要
语言模型的偏差评估在有界比较方面取得了实质性进展,例如明显贬损、刻板印象关联或受控替换下的标签敏感差异。开放式解释提出了一个不同的问题:它们通过分配责任、合法性、背景和不满来指导解释。一个模型可以避免敌对语言,同时使一方在结构上可以理解,而另一方则有个人错误、反应过度或不值得认真对待。我们在生成解释中称这种立场不对称。我们提出对称分解评估(SDE),它用具体的组标签、结构角色重写和明确的支持或反证据来测试配对情况。在受控的 32 个家庭原型套件中,这种分解表明表面差异并不完全相同:有些在结构或证据控制下减弱,而另一些则在模型如何分配责任、背景或合法性方面保持稳定的差异。有针对性的案例审查和法官比较表明,评估开放式框架不对称性存在更广泛的困难:法官的解读随着操作化的不同而变化,标量分数可以压平读者用来解释解释性立场的区别。因此,SDE 将生成偏差评估重新定义为对解释性立场的审核——各方接受的立场、分解下的立场如何变化以及自动评分在何处变得不稳定。