论文

心理健康自然语言处理中的跨平台泛化失败:社交媒体上 Transformer 模型的五轴公平性审核

Cross-Platform Generalisation Failure in Mental Health Natural Language Processing: A Five-Axis Fairness Audit of Transformer Models on Social Media

模型评测鲁棒性、公平性与可信度评测

摘要

我们引入了跨平台公平评估 (CPFE) 框架——一个五轴审计协议,涵盖区分性能、校准、统计显着性、预测公平性和归因稳定性——并将其应用于在 Kaggle 心理健康语料库 (n=35,556) 上训练并在 Reddit 上进行评估的四个 Transformer 模型(BERT、RoBERTa、Emotion-DistilRoBERTa、GoEmotions-RoBERTa) (n=6,257) 和 Twitter (n=2,883) 测试集,情感标签映射到临床代理。相对于平台内性能(AUC 0.983-0.987),所有三个独立评估的模型都表现出一致且显着的跨平台 AUC 下降(Reddit 上为 30.3-35.4%,Twitter 上为 37.9-39.5%),这在五个独立训练种子中得到了证实。校准失败是并发且严重的:ECE 从域内的 0.056-0.060 上升到 Reddit 上的 0.196-0.229 和 Twitter 上的 0.499-0.542。特定于平台的温度缩放将平均 ECE 降低了 88.0%,而不改变判别性能(平均 |delta AUC|<0.01),从而确认了可分离的故障模式。预测权益分析揭示了巨大的跨平台差异(原始 DI < 0.17;Reddit 上的前班调整 DI:0.11-0.29),Reddit 上的心理健康代理类别的均等赔率差异为 0.753-0.830,Twitter 上的焦虑代理类别的均等赔率差异为 0.755-0.831。归因稳定性分析显示跨平台几乎完全的词汇差异(K = 10 时 14/16 模型类对中的 Jaccard J = 0)。这些发现支持将跨所有五个 CPFE 轴的跨平台验证视为异构环境中心理健康 NLP 系统的标准要求。在单种子 微调 实验中,平均 AUC 提高了 0.216,这表明目标平台标签作为训练信号比作为校准信号提供更大的好处。