论文
LLM推理的集成跨架构解读
Integrated and Cross-Architecture Interpretation of LLM Reasoning
摘要
了解 LLM 推理如何受到实际不对称性的阻碍:虽然它们生成的输出是可观察的,但潜在的推理模式仍然不透明。依赖单一探针,例如互信息峰 (MIP) 或深度思考比率 (DTR),可能会低估真正的推理结构。为了解决这一缺陷,我们提出了一个集成的跨架构推理(IAR)框架,旨在为 LLM 推理可解释性提供统一的方法。具体来说,我们首先建议使用带宽校准的 MIP 结合 Tukey IQR 峰值检测来隔离输出层的推理关键标记。其次,我们对 MIP 选取的词元和 DTR 深度词元之间进行了重叠分析,以跟踪这些词元的跨层轨迹。这还揭示了推理关键标记是否也是计算密集型的,进一步有助于理解推理模式如何跨模型层演变。最后,我们在多域问题上应用 Jaccard 稳定性度量来验证 MIP 识别的词元是否具有推理质量保证。对跨四个领域(数学、代码、逻辑和常识)的六个模型进行的广泛实验证明了 IAR 跨架构的通用解释能力。我们的代码可在 https://github.com/LeonardoMatthew/IAR 获取。