论文

DS@GT参加eRisk 2026:结构化算法引导的多智能体会话抑郁筛查系统

DS@GT ARC at eRisk 2026: Hybrid Multi-Agent LLM System with Structured Algorithmic Guidance for Conversational Depression Screening

智能体系统Agent 架构与控制循环

摘要

我们介绍DS@GT参加eRisk 2026任务1(会话式抑郁筛查)的工作:系统采访模拟不同抑郁程度个体的LLM人格,在不直接询问敏感心理健康问题的前提下,为每个人格产出贝克抑郁量表II(BDI-II)得分与四个关键症状。管线经历三个阶段:单体单模型原型起步;基线多智能体架构在协调编排层下把会话访谈与BDI-II评分分离;最终混合配置用开源Gemma 27B替换付费的GPT-5-nano访谈者。为弥补该模型较弱的推理与指令遵循,混合系统增加三个算法组件:预计算的对话树(规范访谈开场与追问)、受Weaver框架启发的可靠性加权共识聚合、以及针对未探查症状的基于聚类的插补。我们在全部20个人格上提交三次全自动运行:Run 1来自付费基线,Run 2与3来自混合系统。混合Run 3取得ADODL 0.9063,在全部完整提交的运行中排第3,使DS@GT在21支队伍中总排名第2,同时以约四分之一的每人格API成本超过付费基线Run 1(0.8841)。结果支持我们的核心假设:在足够的算法监督下,较弱的开源模型可以在会话访谈者角色上与更强的专有模型竞争。源码见https://github.com/dsgt-arc/erisk-task1-2026。

DS@GT参加eRisk 2026:结构化算法引导的多智能体会话抑郁筛查系统:论文配图
图 1:多代理系统架构。面试官代理与 LLM 角色进行逐轮对话,评分代理在每次对话后更新 BDI-II 症状估计和置信水平。编排层对症状优先级进行排序,将采访者引导至最高优先级目标,并强制执行停止条件。完整循环对每个角色运行 10 到 20 个访谈样本,样本聚合步骤通过可靠性加权中值构建共识概要文件,以选择最接近的运行进行提交。