论文

BioMed-Agent-RL:元学习,生物医学应用所需的一切

BioMed-Agent-RL: A Meta Learning, All You Need for Biomedical Applications

智能体系统Agent 架构与控制循环

摘要

临床视觉 大语言模型 (C-VLLM) 的当前进展极大地改善了数字诊断,但这些框架仍然经常在复杂的临床病例中承受病变噪声、模态错位、幻觉和缺失上下文基础。此外,流行的代理系统通常依赖于静态和不可适应的管道,并且缺乏复杂医学推理所需的多功能性。为了解决这些困难,我们提出了 BioMed-Agent-RL,这是一种统一的医疗代理,它结合了适用于生物医学应用的自适应编排、策略和基于奖励的强化学习 (RL) 模型。为了确保可靠性,它调用临床情境感知偏好优化 (CPO)、直接偏好优化 (DPO) 和具有动态熵调节的组相对策略优化 (GRPO)。该管道采用多模式元学习方法,作为特定领域的专家和人类判断合成器运行。该代理通过利用迭代和自适应 RL 方法,在各种临床模式(例如 X 射线)中自适应地利用一组模型级专业知识,例如临床基础和推理器、病变分割器和特定领域合成器。智能体学会认真综合误导性的、相互冲突的视觉线索并信任内在推理,而专家的建议是错误的。在多个基准上进行了深入的消融研究,该代理显着优于现有的最先进模型,例如 GPT-5,与当代基线相比,准确率高达约 73%(增益约 5%)。因此,该框架提出了一个新标准,用于构建事实、可靠、稳健和专家般的智能代理系统,以进行独立的临床推理。