论文
大语言模型的安全线性对齐
Secure Linear Alignment of Large Language Models
摘要
尽管训练目标、架构和数据模式存在差异,但语言模型似乎越来越多地学习相似的表示。独立训练的模型之间出现的这种兼容性为跨模型与下游目标的协调带来了新的机会。此外,它还解锁了新的潜在应用领域,例如安全、隐私或竞争限制禁止直接数据或模型共享的设置。在这项工作中,我们提出了一种隐私保护框架,该框架利用表示收敛来实现独立语言模型之间的跨孤岛推理。该框架学习共享公共数据集上的仿射变换,并应用同态加密来在推理过程中保护客户端查询。通过仅加密线性对齐和分类操作,该方法实现了亚秒级推理延迟,同时保持强大的安全保证。我们通过对表征收敛的实证研究来支持这个框架,其中我们学习独立模型的最终隐藏状态之间的线性变换。我们在嵌入分类和分布外检测上评估这些跨模型映射,观察模型对之间的最小性能下降。此外,我们首次证明线性对齐有时可以跨独立训练的模型生成文本。
