论文
标错症状:评估医学文本中的LLM水印
Marking the Wrong Symptoms: Evaluating LLM Watermarks in Medical Texts
摘要
大语言模型(LLM)日益融入临床工作流,凸显以水印实现模型生成输出可靠溯源的需求。但多数水印在通用基准上评估,医疗等领域——其中token级微小扰动即可造成显著语义变化——仍未被充分探索。本工作首次严格研究LLM水印如何影响医疗表现:在覆盖单模态与多模态临床推理的多任务上,跨11个LLM与7个VLM基准测试5种水印方案。重要的是,我们补充既有评估:引入经人类专家验证的管线,系统审计医学推理质量、术语精确性与诱发幻觉。结果显示:水印可在多种失败模式下诱发实质退化,包括词汇损坏、幻觉术语,以及图像所见误归因或遗漏的放大。值得注意的是,领域专属分析的缺位、加上遗漏临床文本固有失败的聚合指标,会系统性掩盖实际的、水印诱发的退化。我们的发现确立领域专属评估是水印模型在医疗中安全部署的前提——否则现行基准可能掩盖有临床后果的失败。
