论文

用于 大语言模型 隐私保护临床部署的选择性 词元级 加密编辑

Selective Token-Level Cryptographic Redaction for Privacy-Preserving Clinical Deployment of Large Language Models

AI 基础设施AI安全与内容治理基础设施

摘要

虽然 大语言模型 (LLM) 越来越多地用于临床应用,但许多现有管道需要将原始敏感健康信息发送到远程服务器进行处理,这增加了隐私泄露的风险。减轻这种风险的一个自然方法是在传输之前对数据进行加密。然而,加密整个数据集等简单的解决方案会带来高昂的计算、对齐和通信开销,导致大规模实际部署不可行。为了在保持可用性的同时保护隐私,我们提出了通过自适应语言分解 (HERALD) 进行医疗保健加密和编辑,这是一个 词元级 加密编辑框架,旨在通过仅加密敏感词元同时保留下游模型实用程序的周围上下文来实现这种平衡。 HERALD 将医学命名实体识别器 (NER) 与词性 (POS) 驱动策略相结合来选择候选标记,执行有针对性的词形还原以稳定表面形式,并用包含在显式分隔符中的确定性密文替换每个受保护的标记。值得注意的是,HERALD 与模型无关,并且完全在客户端运行,确保敏感内容在整个存储、传输和处理过程中保持加密状态,而无需更改下游模型。我们在公共数据集上的分类和医学问答 (MQA) 任务上评估了 HERALD。在不同的任务中,实验表明,完全安全的基线会遭受严重的效用损失,而 HERALD 始终能够恢复接近明文的性能。总体而言,HERALD 提供了一种新颖的利用渠道。