论文
面向大语言模型证据寻求式诊断推理的强化学习
Reinforcement Learning for Evidence-Seeking Diagnostic Reasoning with Large Language Models
摘要
近期的推理中心大语言模型(LLM)已取得重大进展——但它们主要运作于假设信息完备的被动推理模式。相比之下——真实临床智能本质上是需要策略性证据获取的迭代调查过程。为弥合该缺口——我们将医学诊断形式化为迭代证据寻求任务。我们利用可验证奖励强化学习(RLVR)在闭环环境中引出内在推理——由强制诊断精确性与检查一致性的新奖励套件引导。为此——我们介绍基于检索增强生成的检查模拟器(RAGES)——提供现实、知识锚定的后续证据的高保真临床神谕。跨多样数据集的实证结果表明我们的框架使LLM从被动响应者转变为自主助手。值得注意的是——我们的模型表现出与更大且推理增强基线可比的性能——而RAGES在生成生物学合理的临床反馈方面证明优于原始LLM。
