论文
SuiChat-CN:中文群聊中情境化自杀风险评估的基准
SuiChat-CN: Benchmarking Contextual Suicide Risk Assessment in Chinese Group Chats
摘要
自杀是一项严峻的全球公共卫生挑战,每年造成约72万人死亡,亟需及时有效的预防策略。现有计算研究主要聚焦于Twitter和微博等基于帖子的社交媒体平台,对Telegram等即时通讯环境研究不足。而群聊带来独特挑战:消息简短、碎片化、多方参与,且常依赖隐含或文化特异的表达,使孤立的帖子级分析难以胜任。我们提出SuiChat-CN,一个用于情境化自杀风险评估的中文群聊基准。我们收集公开的Telegram群聊数据,通过信号词提取和双向上下文扩展构建连贯的对话片段,并以经专家验证、LLM辅助的范式标注用户风险等级。SuiChat-CN包含来自1,406名用户的13,312个情境片段,涵盖258,228条原始聊天消息。在PLM和40多个LLM上的大量实验表明,上下文信息对可靠的风险评估至关重要,而微调与部分上下文评估进一步揭示了多方对话中早期检测的困难。出于伦理与敏感性考虑,该数据集不公开发布,但将应合理请求向获得资质的心理健康与自杀预防研究机构共享。
