论文
让 LLM 互相评判:医学问答的多智能体同行评审推理
Let LLMs Judge Each Other: Multi-Agent Peer-Reviewed Reasoning for Medical Question Answering
摘要
目的:提高 大语言模型 (LLM) 在医学问答 (MedQA) 中的准确性、可解释性和稳健性。方法:我们设计了一种多智能体同行评审推理方法,其中多个 LLM 智能体独立生成候选答案的思想链推理,然后充当同行评审员,评估彼此推理的事实正确性和逻辑健全性。选择评分最高的推理链来产生最终答案。我们使用五个最先进的 LLM(Llama-3.1-8B、Qwen2.5-7B、Phi-4、DeepSeek-LLM-7B、GPT-oss-20B)在三个基准数据集:HeadQA、MedQA-USMLE 和 PubMedQA 上进行了实验。将性能与单一模型思想链推理和基于思想链的多数投票进行比较。结果:经过同行评审的推理始终优于两个基线。最佳模型组合在整个数据集中实现了 0.820 的平均准确度,超过了最强的单一模型 (0.777) 和多数投票集成 (高达 0.789)。该方法还可以通过更多的参与模型有效地扩展,而同行评估可以可靠地区分高质量推理链和低质量推理链。结论:所提出的多智能体同行评审推理方法使 LLM 能够充当求解器和评估器,在 MedQA 中产生卓越的性能。通过强调推理质量而不是仅仅回答一致,这种方法提高了准确性、可解释性和鲁棒性,为值得信赖的生物医学人工智能系统提供了一个有希望的方向。