论文

经多智能体评估循环提升医疗AI的安全性与可信度

Improving the Safety and Trustworthiness of Medical AI via Multi-Agent Evaluation Loops

模型推理智能体系统推理验证与自校正Agent Harness

摘要

大语言模型(LLM)在医疗领域应用日益增多,但确保其伦理操守与安全合规仍是临床部署的主要障碍。本工作引入一个多智能体精炼框架,通过结构化的迭代对齐来增强医疗 LLM 的安全性与可靠性。我们的系统把两个生成模型——DeepSeek R1 与 Med-PaLM——与两个评估智能体(LLaMA 3.1 和 Phi-4)结合,后者依据美国医学会(AMA)医学伦理原则和五级安全风险评估(SRA-5)协议对响应进行评估。我们在覆盖九个伦理领域的 900 个多样化临床查询上评估性能,度量收敛效率、伦理违规减少和领域特定风险行为。结果表明 DeepSeek R1 收敛更快(平均 2.34 对 2.67 次迭代),而 Med-PaLM 在隐私敏感场景的处理上更优。迭代多智能体循环使伦理违规减少 89%,风险降级率达 92%,印证了该方法的有效性。本研究提出一个可扩展、与监管对齐且具成本效益的医疗 AI 安全治理范式。

经多智能体评估循环提升医疗AI的安全性与可信度
图1:多智能体评估循环。生成器产生一个初始回答。两个评估器分别依据伦理标准和风险标准并行评估该回答。它们的输出被合并为一个共识决策。如果回答达到安全阈值,循环即停止;否则,生成结构化反馈,由生成器修改其回答。