论文
评估面向养老院的多智能体语音智能音箱:一个聚焦安全的框架
Evaluating a Multi-Agent Voice-Enabled Smart Speaker for Care Homes: A Safety-Focused Framework
摘要
人工智能(AI)正被越来越多地探索应用于健康与社会照护领域,以减少行政工作负担,让工作人员有更多时间投入患者照护。本文评估一款语音养老院智能音箱(Care Home Smart Speaker),其设计用于支持养老机构的日常活动,包括语音访问住民记录、提醒与日程安排任务。论文提出一个聚焦安全的评估框架,端到端地考察该系统,将基于Whisper的语音识别与检索增强生成(RAG)方法(混合、稀疏与稠密)相结合。借助有监督的养老院实地试用与受控测试,我们评估了覆盖11个照护类别的330份语音转录,其中包含184次含提醒的交互。这些评估聚焦于(i)住民与照护类别的正确识别、(ii)提醒的识别与抽取,以及(iii)不确定性下的端到端日程安排正确性(包括安全的延后处理/澄清)。鉴于养老环境的安全攸关性质,我们还特别关注嘈杂环境与多元口音下的可靠性,并借助置信度评分、澄清提问与人在回路监督加以保障。在表现最佳的配置(GPT-5.2)下,住民ID与照护类别匹配达到100%(95% CI:98.86-100),提醒识别达到89.09%(95% CI:83.81-92.80),零漏报(100%召回率)但存在一些误报。经由日历集成的端到端日程安排达到84.65%的提醒数量精确一致率(95% CI:78.00-89.56),表明将非正式口语指令转化为可执行事件仍存在边界情况。研究结果表明,语音系统经过审慎评估并配备适当保障措施后,能够支撑准确的记录、有效的任务管理,以及在养老院场景中可信赖的AI应用。
