论文
为什么要与连续潜在因素作斗争?通过渲染压缩进行可解释的离散潜在推理
Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression
摘要
大语言模型通过显式思维链和强化学习实现较高的推理性能,但需要较长的输出序列和较长的推理时间。潜在推理通过将计算转移到潜在空间来降低这种成本;然而,连续潜在方法很难训练,因为其推理轨迹不稳定且无法解释。我们认为这些问题源于连续空间推理和离散符号监督之间的不一致,因为连续状态缺乏用于逐步对齐的明确锚点。为了解决这个问题,我们提出了 \textbf{Discrete Latent Reasoning~(DLR)},这是第一种将连续潜在状态转换为显式离散标记的方法。受基于渲染的压缩的启发,我们将文本思想链渲染为图像,提取视觉特征,并通过基于聚类的 微调 构建离散的潜在词汇表。扩展词汇表和输出头可以对自然语言和潜在标记进行标准自回归建模,支持预训练对齐、SFT 和 RL。对五个推理基准和两个模型系列(Qwen3-VL 和 LLaMA-3)的实验证实,\textbf{DLR} 的性能优于先前的潜在推理基线,压缩率高达 \textbf{20$\times$ 压缩}。此外,学习到的潜在轨迹保留了可解释的语义结构。总体而言,离散潜在标记为有效的潜在推理提供了可控且可解释的基础。