论文

超越旗帜:临床框架缩小了自杀风险测量的适度差距

Beyond the Flag: Clinical Framing Closes the Moderation Gap in Suicide Risk Measurement

模型评测基准与评测资源

摘要

审核 API 旨在标记违反政策的内容,而不是衡量分级的临床风险。但平台的职责并不止于检测:对被动困境的响应与对手段获取的主动规划的响应截然不同,而新兴法规(例如,加州参议院法案 243)正在将这种区别转变为合规要求。因此,我们询问部署得当的安全信号如何恢复具有临床意义的严重程度。我们发布了 516 个 r/SuicideWatch 帖子的基准,由持证精神病学家按照基于哥伦比亚自杀严重程度评定量表的四级序数模式(指标、想法、行为、企图)进行评级,并评估审核 API、提示 LLM,并在七个序数感知指标下监督基线。三项发现。供应商审核 API 很好地区分了低严重性帖子和高严重性帖子(0.860 高风险 F1),但衡量严重性的效果很差(0.395 宏观 F1),系统性地高估了最严重的类别。基于临床依据的零样本提示弥补了大部分差距(0.562 宏 F1),而专家编写的框架(不是 微调、添加推理或天真的多智能体聚合)是有效的杠杆。推理的价值取决于语体:它对冗长、嘈杂的 Reddit 帖子有害,但对简短、临床医生撰写的陈述有帮助。我们认为,适当的注意义务所要求的是分级严重性,而不是二元标记,并发布我们的评估框架来支持该衡量标准。