论文

MHGraphBench:大语言模型 中基于知识图的心理健康知识基准测试

MHGraphBench: Knowledge Graph-Grounded Benchmarking of Mental Health Knowledge in Large Language Models

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用于心理健康领域,但目前尚不清楚它们捕获相关生物医学知识的程度以及将其应用于临床显着结构化判断的可靠性。在这里,我们提出了一个基于知识图(KG)的基准,用于评估 LLM 的心理健康实体识别、关系判断和两跳推理。该基准源自 PrimeKG,包含九个任务系列,具有 KG 支持的答案和受控的否定选项。跨 15 个封闭源和开源 LLM 的实验揭示了持续存在的识别与判断差距:领先模型在实体类型和小型关系类型子集上实现了接近天花板的性能,但它们仍然在关系预测和两跳推理方面遇到困难。此外,KG 派生的短片段有利于某些模型,但会降低其他模型的性能。此外,输出格式的可靠性可以极大地影响受限多项选择设置下的测量表现,凸显了响应有效性在基于基准的评估中的关键作用。因此,MHGraphBench 应被解释为在受限的多项选择界面下评估与 PrimeKG 策划的心理健康部分的一致性,而不是对现实世界临床安全性的直接评估。