论文

结构与思维链:评估抑郁症严重程度的大语言模型标准提取

Structure vs. Chain-of-Thought: Evaluating LLM Criteria Extraction for Depression Severity

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 可以直接从社交媒体帖子中评估抑郁症的严重程度,或标记帖子显示的临床标准,并让代码将计数转换为标签。后者更容易审核,因为临床医生可以检查每个标记的标准。我们使用三个大语言模型(从 9B 到前沿量表)和两个问卷(PHQ-9、BDI-II)在两个 Reddit 语料库上比较这些方法,并使用二次加权 kappa 来衡量一致性。对于这两个前沿模型,只有当其决策阈值适合标记数据时,标准提取分数才会高于一个语料库的思维链。无论是否在相同标签上重新调整思路链,这两种模型的收益都不显着。根据 PHQ-9 标准先验确定的阈值,即使模型为每个帖子标记了两个以上标准,提取也不会在任何一个语料库上显示任何增益。 9B 模型在抑郁社区的语料库上的表现有所不同。它给大多数帖子贴上了严重的标签,无论是直接提示还是通过思维链,而先验规则在没有标签的情况下击败了这两种帖子。在相同标签上重新校准思路链后,没有留下明显的差距,与校准效果一致。然而较高的序数一致性并不能确保更好地发现严重病例。 PHQ-9 标准提取遗漏了最严重的帖子,从直接提示到思维链再到提取,几乎在所有比较中都会增加遗漏率。在主语料库上,重新标记的压力数据集、使用该数据集自身特征(包括文本中的字数)的模型与先验规则下的前沿标准提取没有显着差异。