论文

利用概念激活向量分析第二语言口语评估系统的偏见

Bias Analysis of L2 Speaking Assessment Systems Using Concept Activation Vectors

模型评测鲁棒性、公平性与可信度评测

摘要

自动口语评估系统在高压力环境中部署,用于标记第二语言(L2)学习者的口语测试。因此,重要的是要证明评分依赖于口语技能而非无关的说话属性,如第一语言(L1)或年龄。基于Transformer的基础模型提高了这些L2评述员的准确度,但其黑盒表示法使公平性和可解释性分析更加困难。在先前工作基础上,使用Concept Activation Vectors (CAVs)检测特征型评述员中的偏见,我们扩展了基于CAV的分析到两个神经口语评估系统:文本基的BERT评述员和基于Whisper的语音-文本多模态评述员。CAVs将人类可解释的概念作为模型激活空间中的方向,使我们能够区分概念是否在模型内部表示中编码以及它们如何影响预测分数,后者使用梯度基敏感性度量量化。由于CAVs依赖于线性分离性,而在复杂神经嵌入空间中不太可能,因此我们还研究了稀疏自编码器(SAEs)是否通过学习CAVs并在稀疏潜空间中进行编码,然后将其映射回激活空间来提供更清晰的概念方向。我们的分析表明,概念可恢复性取决于被探查的表示和架构,而不是单独的概念。敏感度也受架构依赖。SAEs使概念更加线性可恢复,但削弱了原始激活空间中的敏感性,在低维层中尤其明显。这些发现强调了在审计口语评估系统时区分概念可恢复性和概念影响的重要性。