论文

大语言模型的安全线性对齐

Secure Linear Alignment of Large Language Models

模型评测模型行为与机制分析

摘要

尽管训练目标、架构和数据模式存在差异,但语言模型似乎越来越多地学习相似的表示。独立训练的模型之间出现的这种兼容性为跨模型与下游目标的协调带来了新的机会。此外,它还解锁了新的潜在应用领域,例如安全、隐私或竞争限制禁止直接数据或模型共享的设置。在这项工作中,我们提出了一种隐私保护框架,该框架利用表示收敛来实现独立语言模型之间的跨孤岛推理。该框架学习共享公共数据集上的仿射变换,并应用同态加密来在推理过程中保护客户端查询。通过仅加密线性对齐和分类操作,该方法实现了亚秒级推理延迟,同时保持强大的安全保证。我们通过对表征收敛的实证研究来支持这个框架,其中我们学习独立模型的最终隐藏状态之间的线性变换。我们在嵌入分类和分布外检测上评估这些跨模型映射,观察模型对之间的最小性能下降。此外,我们首次证明线性对齐有时可以跨独立训练的模型生成文本。

刻画语言模型间的线性对齐:论文配图
图 1:通过跨模型线性对齐生成文本:我们从 Qwen 的隐藏状态学习仿射映射到 Llama 的特征空间,从而使 Qwen 表示能够由 Llama 的令牌头解码。由此产生的混合模型将 Qwen 的编码器/变压器块与 Llama 的输出头相结合,在不采用任一模型身份的情况下产生一致的响应。