论文
教授 LLM 巴西医疗保健:从官方临床指南中注入知识
Teaching LLMs Brazilian Healthcare: Injecting Knowledge from Official Clinical Guidelines
摘要
巴西的统一医疗系统 (SUS) 依赖于官方临床指南,该指南为 2 亿多公民定义了诊断标准、治疗、剂量和监测程序。然而,当前的 LLM 在该指南特定知识方面表现不佳,并且没有基准评估基于巴西葡萄牙语协议的临床召回。我们通过使 Qwen2.5-14B-Instruct 适应巴西临床领域来解决这一差距。从 178 个官方指南(约 540 万个词元)中,我们使用四个生成器 LLM 生成了三种格式的约 7000 万个合成数据词元——改写、维基风格的文章和问答对。然后,我们应用连续的 预训练,然后是组相对策略优化 (GRPO)。我们引入了 HealthBench-BR(包含 1,780 个平衡的真/假临床断言)和 PCDT-QA(包含由 LLM 法官评分的 890 个开放式临床问题)。我们的最佳模型在 HealthBench-BR 上达到了 83.9%,在 PCDT-QA 上达到了 85.4%,尽管只有 14B 参数,但其性能优于 GPT-5.2、Claude Sonnet 4.6、Gemini 3.1 Pro 和 Google AI Overview 的基于网络的 RAG。消融表明,生成器多样性和强化学习对于这些收益至关重要。我们发布所有数据集、基准和模型权重,以支持巴西葡萄牙语的可重复临床 NLP 研究。代码、数据和模型权重可在 https://github.com/hugoabonizio/clinical-protocols-br 获取