论文
BaT:基于阶段评分细则迈向自进化医学研究智能体
BaT: Towards Self-Evolving Medical Research Agent with Stage Rubrics
摘要
长程智能体已开始自动化能产出代码、报告与研究产物的完整工作流。医学影像工作流是多阶段且数据敏感的,而专家轨迹仍然稀缺且难以共享。结构化基准可以通过阶段级评分细则定位失败,但标准后训练会在下一轮训练前丢弃这些诊断信息。我们提出Benchmark-as-Teacher(BaT),一个面向智能体后训练的递归自改进系统。BaT包含两个相互关联的组件:异步的Stage Bank数据流水线,以及其自改进后训练方法BiCuRL(双层课程强化学习)。Stage Bank在策略更新循环之外合成内容隔离的训练状态。BiCuRL使用固定的保留评估来选择下一阶段课程,用任务评分细则验证rollout,用GRPO更新策略,并将候选检查点送回评估。在AutoMedBench-Lite上,BaT-4B与BaT-9B将其Qwen Instruct基线的Overall分数提高一倍以上。BaT-9B Agent达到79.6 Overall,超过Claude Opus 4.6配合Claude Code的77.5。
