论文
面向可靠临床推理的过程监督多智能体强化学习
Process-Supervised Multi-Agent Reinforcement Learning for Reliable Clinical Reasoning
摘要
临床决策需要对异质证据进行细致推理,并给出可追溯的依据。尽管近期的 LLM 多智能体系统(MAS)展现出前景,它们大多只为结果准确率进行优化,而忽视了符合临床标准的、以过程为依据的推理。一个关键的现实案例是基因-疾病有效性策展,专家必须通过综合多种生物医学证据来判断某个基因是否与疾病存在因果关联。我们为该任务引入一个智能体即工具(agent-as-tool)的强化学习框架,包含两个目标:(i)过程级监督,以确保推理遵循有效的临床路径;(ii)通过分层多智能体系统实现高效协调。我们在 ClinGen 数据集上的评估显示,仅用结果奖励时,配备 GRPO 训练的 Qwen3-4B 监督智能体的 MAS 将最终结果准确率从基础模型监督者的 0.195 大幅提升至 0.732,但过程对齐较差(0.392 F1)。相反,采用过程加结果奖励时,配备 GRPO 训练监督者的 MAS 取得更高的结果准确率(0.750),同时将过程保真度显著提升至 0.520 F1。我们的代码发布于 https://github.com/chaeeunlee-io/GeneDiseaseCurationAgents。
