论文

阅读焦虑还是阅读标签?社交媒体焦虑检测的微调模型和前沿模型的比较

Reading Anxiety or Reading the Label? Comparing Fine-Tuned and Frontier Models for Anxiety Detection on Social Media

模型评测鲁棒性、公平性与可信度评测

摘要

焦虑是最常见的心理健康状况之一,人们经常在寻求临床帮助之前在网上写下相关内容。构建检测工具的从业者面临着一个具体的选择:调用前沿商业模型,在内部微调较小的模型,或部署传统的分类器。我们在单个受控协议下的 Reddit 测试集上比较了涵盖所有三个的六个条件。我们还发现了如何评估此任务的一个困惑。在此使用的语料库中,69.3% 的焦虑标签帖子包含“焦虑”一词或其变体,大约是可比较条件的两倍,因此分类器可以通过关键字匹配而不是通过对条件语言进行建模来获得良好的分数。因此,我们对每个模型进行两次评估,在原始文本上并删除这些术语,并将差异报告为词汇依赖。前沿模型在焦虑 F1 (0.846) 上领先,但 110M 参数的域自适应编码器在没有外部 API 依赖的情况下达到 0.831,而心理健康领域预训练仅占其中的 0.7。词汇依赖性跨越 8.6 到 25.4 个点,并且不跟踪模型能力:LoRA 微调 3B 模型是测试中关键字依赖性最强的条件,甚至高于 TF-IDF 分类器,而前沿零样本模型是最少的。因此,该语料库中公布的数据是上限,并且对于这些数据通常报告的微调模型来说,通货膨胀是最大的。