论文

Evo-MedAgent:以会记忆、能反思、可改进的智能体超越一次性诊断

Evo-MedAgent: Beyond One-Shot Diagnosis with Agents That Remember, Reflect, and Improve

上下文与知识记忆Agent记忆

摘要

工具增强的大语言模型(LLM)智能体可以编排专科分类器、分割模型和视觉问答模块来解读胸部X光。然而,这些智能体仍在孤立地处理每个病例:它们无法跨病例积累经验、纠正反复出现的推理错误,也难以在不依赖昂贵强化学习的情况下调整其工具使用行为。放射科医生会随着每个病例自然进步,而现有智能体却保持静止。在本工作中,我们提出Evo-MedAgent,一个自演化记忆模块,赋予医学智能体在测试时进行跨病例学习的能力。我们的记忆由三个互补存储组成:(1) 回顾性临床情节(Retrospective Clinical Episodes),从相似的既往病例中检索问题解决经验;(2) 自适应程序性启发库(Adaptive Procedural Heuristics),整理带优先级标签的诊断规则并通过反思演化,就像医生打磨自己的内在判断标准;(3) 工具可靠性控制器(Tool Reliability Controller),跟踪每个工具的可信度。在ChestAgentBench上,Evo-MedAgent将GPT-5-mini的多选题(MCQ)准确率从0.68提高到0.79,将Gemini-3 Flash的准确率从0.76提高到0.87。在拥有强基座模型时,在定性诊断任务上,演化记忆比编排外部工具更能有效提升性能。由于Evo-MedAgent无需训练,其单病例开销仅限于一次额外的检索和一次反思调用,因而可部署在任何冻结模型之上。

Evo-MedAgent:以会记忆、能反思、可改进的智能体超越一次性诊断:论文配图
图 1:Evo-MedAgent 概述。工具增强的 LLM 代理按顺序处理 CXR 问题,同时通过测试时学习读取和写入自我进化的内存。在解决问题之前,代理会检索相关的情景案例、程序规则和工具治理指南。在收到真实反馈后,它会反映并完善所有三个记忆存储。