论文
MedEvoEval:经仿真临床episode评估医生智能体的持续演化
MedEvoEval: Evaluating Continual Evolution of Doctor Agents through Simulated Clinical Episodes
摘要
医生智能体正从单轮答案生成走向演化的临床决策系统。在门诊episode内——它们获取证据、使用检查与会诊资源——并决定何时敲定诊断与管理计划。跨episode——其行为可能经记忆、检索、反思或其他更新机制改变。当前评估仅部分覆盖该设定。固定输入医疗QA基准从完整输入给最终答案打分——而许多交互基准仍聚焦单次会诊或固定运行——对评估episode级决策如何与跨episode经验交互的支持有限。我们介绍MedEvoEval——基于动作门控仿真门诊episode的可执行纵向评估框架。每个源病例被转换为角色专属的患者、检查与管理员视图;证据仅经有效动作揭示;每个episode记录链接观察、动作、最终输出、管理员分数与可选经验写回的结构化踪迹。我们发布含700个处理后episode的可运行E&D工件——附来源说明、模式、episode运行器、评分脚本、配置、示例日志、分析代码——以及轨迹级与步级衍生数据。实验表明episode踪迹暴露最终答案评分隐藏的过程成本——展示MDT式会诊如何重新分配资源——并支持记忆成熟、留出迁移、更新阶段响应与向后保持的纵向分析。合起来——这些结果表明MedEvoEval为评估医生智能体能否经经验改进、迁移有用行为并随时间保持早期能力提供具体基础。
