论文

潜在思考,语言解释:可自我解释的潜在推理

Think in Latent, Explain in Language: Self-Explainable Latent Reasoning

模型训练监督微调与指令调优

摘要

潜在推理已成为基于文本的思想链 (CoT) 的强大替代方案,通过将冗长的推理压缩为紧凑的嵌入,显着提高了计算效率。然而,将推理压缩到潜在空间会使思维变得不透明,阻碍其可解释性。当前的方法存在明显的权衡:它们要么充当无法解释的“黑匣子”(例如,Coconut),其中潜在推理不是人类可读的,要么依赖单独的事后解码器来实现可解释性(例如,Heima),引入架构开销并将解释与实际推理过程脱钩。在这项工作中,我们提出了一个统一的自解释潜在推理(SELR)框架,它训练单个模型来执行高效且本质上可解释的潜在推理。我们的核心贡献是一个新颖的多任务训练目标,它同时优化两个目标:(1)优化潜在推理轨迹以产生准确的最终答案的答案损失,以及(2)显式训练相同模​​型以将其自身的潜在表示解码回人类可理解的推理步骤的 CoT 损失。这种设计确保生成的潜在表示既具有任务效率又具有语义可解释性,从而无需外部解码器。我们在 大语言模型 (LLM) 和视觉语言模型 (VLM) 上验证了 SELR 的有效性,证明 SELR 与基线相比实现了卓越的词元效率和准确性,同时独特地提供了无需辅助模型的独立可解释性。项目页面位于 https://jasondayuan.github.io/SELR/。