论文

标错症状:评估医学文本中的LLM水印

Marking the Wrong Symptoms: Evaluating LLM Watermarks in Medical Texts

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型(LLM)日益融入临床工作流,凸显以水印实现模型生成输出可靠溯源的需求。但多数水印在通用基准上评估,医疗等领域——其中token级微小扰动即可造成显著语义变化——仍未被充分探索。本工作首次严格研究LLM水印如何影响医疗表现:在覆盖单模态与多模态临床推理的多任务上,跨11个LLM与7个VLM基准测试5种水印方案。重要的是,我们补充既有评估:引入经人类专家验证的管线,系统审计医学推理质量、术语精确性与诱发幻觉。结果显示:水印可在多种失败模式下诱发实质退化,包括词汇损坏、幻觉术语,以及图像所见误归因或遗漏的放大。值得注意的是,领域专属分析的缺位、加上遗漏临床文本固有失败的聚合指标,会系统性掩盖实际的、水印诱发的退化。我们的发现确立领域专属评估是水印模型在医疗中安全部署的前提——否则现行基准可能掩盖有临床后果的失败。

标错症状:评估医学文本中的LLM水印:论文配图
图 1:我们的评估流程概述。给定一个多模态基准实例,我们提示带有或不带有水印的 VLM(使用思想链提示)以供参考。我们首先评估答案中水印的可检测性及其准确性。然后,我们使用三位特定的大语言模型作为评委,更深入地检查推理痕迹,并由临床专家验证。