论文
大语言模型 可以在医疗问答中自我纠正吗?探索性研究
Can Large Language Models Self-Correct in Medical Question Answering? An Exploratory Study
摘要
大语言模型(LLM)在医学问答(医学QA)方面取得了强劲的表现,并且思想链(CoT)提示通过引出明确的中间推理进一步提高了结果;与此同时,自我反思(自我纠正)提示被广泛认为可以通过提示 LLM 批评和修改自己的推理来提高模型可靠性,但其在安全关键型医疗环境中的有效性仍不清楚。在这项工作中,我们对医学多项选择题回答的自我反思推理进行了探索性分析:使用 GPT-4o 和 GPT-4o-mini,我们将标准 CoT 提示与迭代自我反思循环进行比较,并跟踪预测如何在三个广泛使用的医学 QA 基准(MedQA、HeadQA 和 PubMedQA)上的反思步骤中演变。我们分析自我反思是否会导致错误纠正、错误持续存在或引入新错误。我们的结果表明,自我反思提示并不能始终如一地提高准确性,其影响高度依赖于数据集和模型:它对 MedQA 产生适度的收益,但对 HeadQA 和 PubMedQA 带来有限或负面的好处,并且增加反思步骤的数量并不能保证更好的性能。这些发现凸显了推理透明度和推理正确性之间的差距,表明自我反思推理最好被视为理解模型行为的分析工具,而不是提高医学 QA 可靠性的独立解决方案。