论文

超越最终标记分类:基于证据的自杀风险检测的异构读数

Beyond Final-Token Classification: Heterogeneous Readouts for Evidence-Grounded Suicide Risk Detection

模型推理解码与生成控制

摘要

IEEE BigData Cup 基准测试结合了三个具有不同输出结构的预测问题:序数自杀风险分类、多标签心理社会因素检测和支持短语提取。我们引入异构读出分解(HRD),它将语义验证与输出实现分开。本地部署的 Qwen3.8-27B 模型采用特定于任务的 QLoRA 适配器,可为卡条件查询生成答案词元边距和第 63 层答案状态。 HRD 比较有序风险的四个潜在分数,保留大多数因素的标记裕度,同时通过一个共享潜在探针路由七个标签,并从具有校准的风险条件约束的逐字范围候选者构建证据集。在两个保留的用户分组确认折叠中,潜在风险读数将加权 F1 从 0.8237 提高到 0.8372,将宏观 F1 从 0.7965 提高到 0.8185。选择性因子路由将宏 F1 提高了 0.0105,将尾标签宏 F1 提高了 0.0189;相反,全局潜在替换和独立的标记特异性探针会失败。受限证据解码器在行级折叠评估中将合并短语 F1 从 0.7488 提高到 0.7609。 Lenormand 的最佳公开结果是子任务 1 上的 0.8052 和子任务 2 上的 0.6636,综合得分为 0.7627。这些结果将答案标记边界(而不是单独的语义表示)识别为该基准测试中可测量的错误源。