论文
MedZERO:受控知识积累的自演化医学推理 Agent
MedZERO: Self-Evolving Agents for Open-Ended Medical Reasoning Through Controlled Knowledge Accumulation
摘要
大语言模型(LLM)在医学问答和临床推理方面表现出了希望,但其改进仍然受到静态参数知识和昂贵的专家监督的限制。自我进化的智能体提供了一种有前途的替代方案,使模型能够通过迭代任务生成和问题解决来改进。然而,大多数现有的自进化方法都是为易于验证的领域(例如数学和编码)而设计的,可以通过确切的答案或可执行程序来检查解决方案。医学推理有着根本的不同:它是开放式的、知识密集型的,而且通常只能部分验证。我们推出 MedZERO,一个用于开放式医学推理的自我进化框架。 MedZERO 将生成前沿医学问题选项对的 Examiner 与 Reasoner 结合起来,Reasoner 通过基于证据的多轮推理和外部知识工具来解决这些问题。为了支持可靠、持续的改进,MedZERO 采用受控知识积累,维护临时探索性知识和策划持久性推理知识。我们在开放式评估下使用 4B 和 8B 规模的基本模型在五个公共医学推理基准上评估 MedZERO。在所有设置中,MedZERO 始终优于底层基础模型和之前的自我进化基线,与次佳自我进化基线相比,平均准确度提高了 13.7 个点。
