论文

医疗保健 NLP 代理的工作流程感知基准测试

Toward Workflow-Aware Benchmarking for Healthcare NLP Agents

智能体系统Agent任务评测

摘要

大语言模型 (LLM) 代理越来越多地被提议用于医疗保健任务,例如临床文档、证据检索、患者消息传递和护理协调。然而,许多评估仍然仅限于静态医学问答或一次性生成、纵向状态代表性不足、中断和人工切换。我们为医疗保健 NLP 代理引入了情节级评估协议。该协议将证据跨模型、代理和模拟工作流行为分开;指定一个五字段情节模式;并定义状态连续性、证据可追溯性和升级决策的注释和评分。它被实例化为四个任务模板:文档更新、证据检索、患者消息传递和分类切换。该协议并未声称可以衡量临床结果或部署价值。相反,它在静态基准和前瞻性工作流程研究之间提供了一个可重复的中间评估层,并对错过的升级和不必要的升级进行了明确的成本敏感处理。