论文
当患者插话时:将临床对话式人工智能安全性扩展到中断
When Patients Cut In: Extending Clinical Conversational AI Safety to Interruptions
摘要
临床语音代理现在被部署在日常护理中,真正的病人不会等待轮到他们:他们会打断。这些系统通常使用级联架构(语音到文本 -> LLM -> 文本到语音),因此当患者在说话过程中切断代理时,即使模型很好地处理协作转录本,临床所需的内容也可能会丢失。然而,临床对话人工智能基准几乎普遍假设患者等待代理完成,错过了因中断而导致的所需内容丢失。我们提出了基于转录的中断恢复评估,将对话分析重叠类别调整为三种操作类型(识别、竞争、过渡子单元),并在跨越历史记录(信息收集)和常见问题解答(信息提供)的四个单元中测试四种面向部署的非推理 LLM 配置,根据代理是否保留临床所需的内容进行评分。在收集单元中,目标问题失败的情况因模型而异。在供应单元中,武器可以直接比较,每种型号的失败都会增加。各个单元的排名有所不同,竞争性常见问题解答中断导致所有四种模型的供应覆盖率达 30/30 失败(威尔逊 95% CI:88.6-100.0%;基线 3 个模型为 0/30,Llama 为 4/30)。一个简短的道歉标记(“抱歉打扰”)会使恢复速度降低数十个百分点,这在不同模型中不一致,并且它会降低恢复速度。因此,中断鲁棒性不能是单一分数:评估必须以内容为基础,按单元进行报告,并与部署的中断配置文件相匹配。