论文
当正确信念崩塌:LLM在临床压力下的认知韧性
When Correct Beliefs Collapse: Epistemic Resilience of LLMs under Clinical Pressure
摘要
尽管在医学基准上准确率很高,LLM在临床对话中仍可能表现出严重的多轮谄媚(sycophancy),在步步升级的压力下放弃最初正确的诊断。我们提出Med-Stress,一个评估压力逐步升级下信念稳定性的定向压力测试框架。在九个前沿大语言模型(LLM)上,我们发现医学知识与鲁棒性之间存在清晰的分离:初始诊断能力强并不意味着信念稳定性高,若干LLM呈现出巨大的知识-鲁棒性差距。为缓解这一失效模式,我们提出轻量级的推理时防御RBED(Role-Based Epistemic Defense,基于角色的认知防御),以及R-FT(Resilience-oriented Fine-Tuning,面向韧性的微调)——一种将基于证据的抗压能力内化到模型中的训练时方法。实验表明,R-FT几乎消除了信念改变,并大幅提升了鲁棒性。
