论文

GPAgentBench-2K:复杂临床行动空间中 大语言模型 代理的基准测试

GPAgentBench-2K: Benchmarking Large Language Model Agents in Complex Clinical Action Space

智能体系统Agent任务评测

摘要

大语言模型 (LLM) 显示出作为临床代理的巨大潜力,但现有基准将临床工作流程简化为静态预测或具有粗动作集的无约束马尔可夫决策过程 (MDP)。为了解决这个问题,我们推出了 GPAgentBench-2K,这是第一个用于初级保健临床决策的约束 MDP (CMDP) LLM 代理基准,由专家验证的真实 GP 就诊记录构建而成。我们的环境对六种基本临床行动进行全方位建模,在行动空间之前强加拓扑工作流程,并将安全知情的弃权作为一流的结果。评估 16 个最先进的 LLM 发现,随着操作空间的扩展,性能会显着下降。至关重要的是,我们发现了临床质量安全差距:即使是具有最高诊断准确性的前沿模型,在超过一半的高风险病例中也会违反安全限制。最后,我们使用约束组相对策略优化 (C-GRPO) 建立了一个参考点,并表明虽然显式建模约束比无约束的 RL 方法提高了性能,但它距离临床可接受的安全性还很远。