论文

面向临床智能体的世界反馈:FHIR环境中的RL诊断

World Feedback for Clinical Agents: Diagnosing RL in FHIR Environments

智能体系统模型训练强化学习Agent任务评测Agentic RL

摘要

临床协议执行任务——检查化验值、应用阈值、下达结构正确的FHIR医嘱——是来自世界反馈的强化学习的天然候选:一旦临床领域专家将决策逻辑编码进验证器——该验证器即可为无限rollout评分——而无需逐episode标注。但应用RL需要健全的反馈通道与足够的基座能力。我们审计MedAgentBench v1/v2——发现41.7%的静默完成上限——使不行动成为RL的占优策略——并构建MedAgentBench-v3(MAB-v3)(508任务、8.9%上限)。训练Qwen3-8B暴露两个结构性障碍:能力天花板(20个任务类型中10个基座性能为0%、零梯度)与格式-知识壁垒(20个类型中3个要求探索无法发现的精确临床编码)。纯RL达到18.2% pass@1——而基于规则的SFT为34.1%;15.9个百分点的差距完全归因于这些障碍。决策/格式知识/查询三分类预测RL可学性并给出药方:SFT注入编码、RL学习条件逻辑。