论文
以患者为中心的对话式AI的复杂性
The complexities of patient-centred conversational artificial intelligence
摘要
由大语言模型(LLM)驱动的面向消费者的健康聊天机器人日益用于症状评估。但聊天机器人的开发与评估常依赖配合的、表达清晰的模拟患者。我们分析2,053次真实患者—聊天机器人对话,发现沟通模式与情绪表达跨用户差异巨大。我们开发一个分别建模临床内容、情绪状态、会话策略与沟通风格的患者模拟器。在15名人类评分员参与的图灵式真实性评估中:模拟对话与真实对话几乎不可区分——人类评分员准确率仅55%。我们以五种不同的患者人格、跨1,164个临床医生评分案例,评估四个LLM在紧急度评估上的表现。我们发现沟通风格可以显著改变分诊结果。以患者为中心的对话式AI必须容纳沟通多样性:为理想化而非真实交互设计的系统,在真实世界部署时有表现不佳并放大健康差异的风险。