论文
解锁潜在推理的黑匣子:一种可解释性引导的干预方法
Unlocking the Black Box of Latent Reasoning: An Interpretability-Guided Approach to Intervention
摘要
潜在推理使 大语言模型 (LLM) 能够在连续隐藏状态中执行多步推理,从而比显式思想链 (CoT) 提供效率提升。然而,这些连续思想向量的不透明性阻碍了它们的可靠性和可控性。本文弥合了机械可解释性和可操作控制之间的差距。我们首先使用结构、因果和几何探针进行系统分析,揭示潜在向量编码压缩的、忠实的推理步骤表示,而早期向量充当关键的因果中心。在此基础上,我们将这些可解释性见解运用到一套 无需训练 解码时间干预中,通过施加已识别的几何和语义先验来完善潜在推理过程。跨多个模型规模和不同任务领域的广泛实验表明,我们的方法持续提高推理准确性。我们以可解释性为指导的干预措施始终如一地释放潜在能力并提高推理准确性,而无需任何参数更新。