论文
开发并评估一款支持孕产妇保健的聊天机器人
Developing and evaluating a chatbot to support maternal health care
摘要
利用基于手机的聊天机器人提供可信的孕产妇健康信息可能产生重大影响,尤其是在用户健康素养低、就医途径有限的低资源环境中。然而,部署此类系统在技术上充满挑战:用户查询简短、欠明确且跨语言混杂,答案需要区域情境特有的依据,而症状上下文的部分或全部缺失使安全分诊决策变得困难。我们展示一款面向印度孕产妇健康的聊天机器人,它由学术研究者、一家健康科技公司、一家公共卫生非营利组织和一家医院合作开发。该系统结合了:(1)孕程感知的分诊,将高风险查询路由至专家模板;(2)在精选孕产妇/新生儿指南上的混合检索;以及(3)由LLM进行的证据条件化生成。我们的核心贡献是一套面向高风险部署、在有限专家监督下运作的评估工作流。围绕组件级和端到端测试,我们引入:(i)一个带标注的分诊基准(N=150),实现86.7%的急诊召回率,并明确报告漏诊急诊与过度升级之间的权衡;(ii)一个带块级证据标注的合成多证据检索基准(N=100);(iii)使用临床医生共同设计的标准,在真实查询(N=781)上进行的LLM-as-judge比较;以及(iv)专家验证。我们的发现表明,在多语言、嘈杂环境中构建可信医疗助手需要纵深防御设计与多方法评估相配合,而不是依赖任何单一的模型或评估方法选择。
