论文
GuideSkill:演化可执行LLM智能体技能以实现指南锚定的临床推理
GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning
摘要
临床实践指南(CPG)编码了诊断标准,但LLM系统通常只是检索指南文本或通过训练吸收它,而非执行其规则。我们提出GuideSkill,一个外部推理层,它将疾病特定标准编译为返回序数诊断支持得分的可执行函数。GuideSkill-Zero从指南初始化,而GuideSkill-Evo利用病例-诊断对来精炼已有技能并补充缺失诊断。在推理时,LLM提出鉴别诊断,落地每个匹配技能所需的特征,并将其排序与执行所得技能得分融合。在四个基准与四个主干上,GuideSkill-Zero相对指南RAG平均提升宏平均准确率13.45%。GuideSkill-Evo在每个主干上都取得最高宏平均,相对直接推理提升18.49%,并将金标技能覆盖率从56.5%提高到99.5%。在Qwen3.5-9B上,它还在不更新主干的情况下超过最强的参数更新基线11.16%。专家评估进一步表明,GuideSkill产出的技能在临床上合理且被广泛接受,说明其初始化与演化规则可靠且具有实际意义。这些结果支持将可执行技能作为一种模型无关的机制,用以结合指南衍生流程与病例衍生诊断模式。
