论文

ECG-Agent:面向心电图多轮对话的端侧工具调用智能体

ECG-Agent: On-Device Tool-Calling Agent for ECG Multi-Turn Dialogue

智能体系统Agent 工具调用

摘要

多模态大语言模型的最新进展迅速扩展到心电图领域,聚焦于分类、报告生成和单轮问答任务。然而,这些模型在真实场景中存在不足:缺乏多轮对话能力、端侧效率以及对PQRST间期等心电图测量的精确理解。为解决这些局限,我们提出ECG-Agent,首个基于LLM的工具调用多轮心电对话智能体。为促进其开发与评估,我们还提出ECG-Multi-Turn-Dialogue(ECG-MTD)数据集,一个面向多样心电导联配置的真实用户-助手多轮对话集合。我们开发了多种规模的ECG-Agent,从端侧可部署到更大规模。实验结果表明,ECG-Agent在回答准确率上优于基线ECG-LLM。此外,端侧智能体在评估回答准确率、工具调用能力和幻觉的多项评测中取得与更大智能体相当的性能,证明了其在真实应用中的可行性。

ECG-Agent:面向心电图多轮对话的端侧工具调用智能体
图2:(左) ECG-MTD 数据集构建的总体流水线。对话场景由取自在线医疗问诊数据集的七个主题类别以及来自官方 CEFR 指南的三个英语水平等级定义。动作序列由预定义的用户与智能体动作构成。采样一个主题类别、一个用户 CEFR 等级和一个动作序列来提示 Gemini-2.5-Flash 生成 ECG 多轮对话。(右) ECG-Agent 的训练框架。用户查询被送入 ECG-Agent,智能体能够使用三种不同的工具生成对用户的响应。该过程在多轮对话中重复多次。