论文
用于乳腺癌治疗建议的Agent系统评估
Agentic systems for breast cancer treatment recommendations
摘要
大语言模型 (LLM) 越来越多地被探索用于临床决策支持,但其在复杂肿瘤治疗计划中的可靠性仍不清楚。我们使用 72 个跨 I 至 IV 期的真实临床病例和通过不对称信息评分标准生成 (AIRG) 生成的 1,147 个特定病例评分标准,评估了用于生成乳腺癌治疗建议的代理 LLM 系统,其中评分标准生成器可以获得评估模型无法获得的真实临床决策。比较了七个管道,包括单 LLM 基线、工具增强系统以及具有事实检查和自主子代理生成的多代理架构。性能最佳的配置是采用 D&C+SA 管道的 Claude Opus 4.8,获得了 0.594 $\pm$ 0.025 的全局得分。工具的使用和代理自主权的增加产生了好坏参半的影响,在某些情况下提高了性能,但在其他情况下却降低了性能。表现因临床领域和疾病阶段而异,肿瘤学家主导的错误分析揭示了持续的临床相关失败,包括不正确或缺失的建议、有缺陷的理由、引用错误、过时的主张和过度自信。这些发现表明,代理 LLM 系统可以生成临床相关的乳腺癌建议,但仍不足以用于无人监督的临床使用。