论文
将预训练的大语言模型重新用作高保真连续文本自动编码器
Repurposing Pre-trained LLMs as High Fidelity Continuous Text Autoencoders
摘要
下一个标记预测实现了高度流畅的自回归语言模型,但它仅通过顺序分解间接表示全局结构。相比之下,高保真自动编码器已成为图像生成中的标准原语,使生成模型能够在连续的潜在空间上运行;文本缺乏相对忠实的连续表示。我们提出了 LLMAE,一种通过暴露内部激活中的中间固定长度潜在瓶颈,将预训练的仅解码器语言模型重新用作连续文本自动编码器的方法。 LLMAE 使用参数高效的 270M Gemma 3 模型进行实例化,使用结构化注意掩模、LoRA 适应和 KL 正则化来学习利用原始 LLM 的生成先验的自动编码接口。我们训练 LLMAE 来重建最多 1024 个标记的文本序列,显着改进了这项任务,以实现近乎完美的重建。此外,我们通过使用学习到的 LMAE 自动编码器训练用于详细图像字幕的潜在文本扩散模型,展示了这种表示的下游实用性。通过将文本映射到固定长度的连续潜在空间,我们的方法为下游适应提供了有效的基础,同时受益于原始大语言模型的流畅性。