论文

当正确信念崩塌:LLM在临床压力下的认知韧性

When Correct Beliefs Collapse: Epistemic Resilience of LLMs under Clinical Pressure

模型评测鲁棒性、公平性与可信度评测

摘要

尽管在医学基准上准确率很高,LLM在临床对话中仍可能表现出严重的多轮谄媚(sycophancy),在步步升级的压力下放弃最初正确的诊断。我们提出Med-Stress,一个评估压力逐步升级下信念稳定性的定向压力测试框架。在九个前沿大语言模型(LLM)上,我们发现医学知识与鲁棒性之间存在清晰的分离:初始诊断能力强并不意味着信念稳定性高,若干LLM呈现出巨大的知识-鲁棒性差距。为缓解这一失效模式,我们提出轻量级的推理时防御RBED(Role-Based Epistemic Defense,基于角色的认知防御),以及R-FT(Resilience-oriented Fine-Tuning,面向韧性的微调)——一种将基于证据的抗压能力内化到模型中的训练时方法。实验表明,R-FT几乎消除了信念改变,并大幅提升了鲁棒性。

当正确信念崩塌:LLM在临床压力下的认知韧性:论文配图
图 1:医疗压力评估框架概述。从第 0 回合(初始答案)开始,模型受到四种不同的攻击策略:基线、权威、逻辑陷阱和安全压力。 NN 施加压力后,模型从正确诊断到阿谀奉承反应的转变会被记录下来。