论文
流递归模型 (SRM)
Stream Recursion Model (SRM)
摘要
机械可解释性旨在对大型语言模型(LLM)的内部行为做出可验证的陈述。许多可解释性技术很难随着架构规模和深度的增加而扩展。我们的解决方案是引入具有可解释性结构的较小模型。在这项工作中,我们引入了流递归模型(SRM),它是分层推理模型(HRM)的修改版,旨在公开内部计算结构,同时保持可扩展性。 SRM 将计算组织为多个交互的潜在流,这些潜在流通过递归细化进行更新,从而能够直接分析流动态、因果贡献和路由行为。 SRM 在每个参数的基础上实现了与 GPT-2 相当的性能。我们的分析揭示了跨流的一致且独特的行为,表明结构化的专业化和交互。这些结果表明,SRM 为可扩展的机械可解释性提供了实用的架构基础,并为推理性能和可解释性的未来研究开辟了有希望的途径。