论文

快速医疗互操作性资源 (FHIR) 中工具调用代理的强化学习

Reinforcement Learning for Tool-Calling Agents in Fast Healthcare Interoperability Resources (FHIR)

智能体系统Agent 工具调用

摘要

快速医疗保健互操作性资源 (FHIR) 是医疗保健数据可互操作交换的主导标准。在 FHIR 中,电子健康记录形成了资源的有向图。通过 FHIR 回答有临床意义的问题需要代理跨多种资源类型执行多步骤推理、过滤和聚合。先前的工作表明,即使是工具增强的 LLM 代理(检索、代码执行、多轮规划)也经常选择错误的资源或违反遍历约束。我们在 FHIR-AgentBench 的背景下研究这个问题,FHIR-AgentBench 是针对现实世界医院数据进行实际问题回答的基准,并将 FHIR 的框架推理作为可查询结构化图上的顺序决策问题。我们实现了一个多轮 CodeAct 代理,并使用自定义工具和工具通过强化学习对其进行后训练。 LLM Judge 提供以执行为基础的奖励。与基于提示的封闭模型基线相比,RL 后训练 在实施数据完整性约束的同时提高了性能。根据经验,我们的方法使用更小、更便宜的 Qwen3-8B 模型,在 FHIR-AgentBench 上将答案正确率从 50% (o4-mini) 提高到 77%。我们提出了一个端到端的 后训练 管道(环境构建、Harness构建、模型训练 和自定义评估),可以可靠地改进结构化临床图的多轮推理。