论文
LEX-EC:黑盒设置中零样本 LLM 人格分类的词汇证据通道审计框架
LEX-EC: A Lexical Evidence-Channel Audit Framework for Zero-Shot LLM Personality Classification in Black-Box Settings
摘要
大语言模型 可以轻松地从文本中分配个性标签,但模型的可解释性仍然是一个悬而未决的问题。为了解决这一差距,我们引入了 LEX-EC,这是一个可重复使用的黑盒审计框架,将流行度和一致性诊断与受控词汇消融相结合,以区分边际分布效应和在有限证据下可恢复的特征相关信号。使用这个框架,我们说明了不同的文本类型如何表现出截然不同的特征:自由形式的论文文本包含最广泛但仍然较弱的信号;在研究生介绍中,可观察到的外向性关联在掩盖后减弱;即使在特征平衡的样本中,单个 Facebook 状态也几乎无法提供稳定的证据,表明内容或长度可能存在下限。掩盖主题和人口统计内容削弱了一些关联,同时使其他关联可以从虚词、情感术语和认知风格词汇中检测到。语言提示改变了模型的自我解释,但并没有消除主题内容。 LEX-EC 联合评估分类普遍性、项目级关联、机会校正一致性、词汇限制下的持久性以及模型生成的解释的即时敏感性。通过数据集、模型和提示,LEX-EC 描述了特质关联如何随可用词汇证据而变化,引入了词汇方法在人格标签中黑盒可解释性的新颖应用。