论文
创建多语言心理健康对话数据集:通过国籍和语言进行基于角色的本地化的局限性
Creating Multilingual Mental Health Dialogue Datasets: Limits of Persona-Based Localization via Nationality and Language
摘要
人工智能和 大语言模型 (LLM) 已成为应对全球心理健康挑战的有前途的工具。尽管这些挑战具有全球性,但用于训练和评估此类系统的高质量数据集仍然严重短缺。为了缩小这一差距,研究人员越来越多地生成合成临床角色来模拟用户数据并测试数字心理健康支持系统。然而,大多数经过验证的角色都依赖于以英语为中心的上下文。本文研究了是否可以使用类似的基于角色的方法来生成多语言心理健康数据集。我们修改了角色中的国籍和语言参数,以生成普通话、孟加拉语和印地语的临床对话。然后,我们检查了不同的 LLM 在根据英语基线评估这些生成的多语言数据集的抑郁严重程度时的表现。我们的研究结果表明,仅在角色中添加国籍和语言参数可能还不够,因为它可能会导致跨语言的临床不一致。 LLM 判断模型在评估非英语文本中的抑郁严重程度时经常表现出不准确,不同模型的表现各不相同。这暴露了将以英语为中心的角色应用于多语言环境的系统局限性。最终,我们的工作强调了迫切需要生成具有文化适应性的数据,以确保全球精神卫生系统的公平。