论文

BaT:基于阶段评分细则迈向自进化医学研究智能体

BaT: Towards Self-Evolving Medical Research Agent with Stage Rubrics

模型训练强化学习Agentic RL

摘要

长程智能体已开始自动化能产出代码、报告与研究产物的完整工作流。医学影像工作流是多阶段且数据敏感的,而专家轨迹仍然稀缺且难以共享。结构化基准可以通过阶段级评分细则定位失败,但标准后训练会在下一轮训练前丢弃这些诊断信息。我们提出Benchmark-as-Teacher(BaT),一个面向智能体后训练的递归自改进系统。BaT包含两个相互关联的组件:异步的Stage Bank数据流水线,以及其自改进后训练方法BiCuRL(双层课程强化学习)。Stage Bank在策略更新循环之外合成内容隔离的训练状态。BiCuRL使用固定的保留评估来选择下一阶段课程,用任务评分细则验证rollout,用GRPO更新策略,并将候选检查点送回评估。在AutoMedBench-Lite上,BaT-4B与BaT-9B将其Qwen Instruct基线的Overall分数提高一倍以上。BaT-9B Agent达到79.6 Overall,超过Claude Opus 4.6配合Claude Code的77.5。

BaT:基于阶段评分细则迈向自进化医学研究智能体:论文配图
图1:Benchmark-as-Teacher 将仅输出的基准转变为后训练基础设施。(a) 上:概念概览。BaT 借助 Stage Bank 数据合成流程、课程教师(Curriculum Teacher)与 BiCuRL 后训练方法,把通常仅输出的基准转变为训练基础设施。(b) 左下:BiCuRL 循环。系统由四个运行阶段构成闭环。第一,SFT 冷启动之后,基准评测按阶段拆分为分阶段得分。第二,汇总得分输入课程教师,图中呈现为域偏移检测器(Domain-Shift Detector)与用于下一轮的报告。第三,环境沙箱池选取目标阶段(S-target)沙箱,连同混合阶段(S-mix)与端到端(E2E)沙箱。第四,智能体在这些沙箱中执行 rollout,LLM 验证器以量规作奖励(rubric-as-rewards)(Gunjal et al., 2026)为其打分,GRPO(Shao et al., 2024)更新策略。更新后的检查点回环至基准评测并重启循环。(c) 右下:训练轮次。虚线曲线显示每轮的评估,实线阶梯线追踪迄今为止的最佳检查点,星号标记自动选出的最佳检查点。