论文

智能手术室语音交互多Agent系统:架构设计与关键技术

A Voice-Interactive Multi-Agent System for Smart Operating Rooms: Architecture Design and Key Technologies

智能体系统Agent 架构与控制循环

摘要

本文介绍了 SurgicalRoomAgent,这是一种基于大语言模型 (LLM) 的智能手术室语音交互多智能体系统。该系统通过由语音交互管道(唤醒、ASR、轮次检测、智能体推理、TTS)和智能体核心(技能注册、任务规划器、设备管理器)组成的分层架构实现自然语言理解、设备控制、术中记录和手术报告生成。研究了三个关键技术:(1)用于低延迟推理的KV缓存前缀预热,通过字节级最长公共前缀重用将重新计算开销从大约500毫秒减少到数十毫秒; (2) 流式部分 JSON 解析与早期并行任务执行,将端到端延迟减少约 30%; (3)渐进式技能提示公开,根据用户角色、连接的设备和手术阶段动态过滤系统提示,以在有限的上下文窗口内最大化信息密度。该系统是使用结合文中所列推理引擎的 Qwen3-27B 模型来实现的。实验分析证明在 16,384 个Token上下文限制内有效运行,并且多设备并行控制响应时间满足 手术室实时要求。