论文
宏观:Transformer 层的马尔可夫链路由
MACRO: Markov Chain Routing of Transformer Layers
摘要
标准 大语言模型 (LLM) 按顺序执行层。动态层路由,即通过涉及层重复、跳过和其他移动的层搜索不同的执行路径,可以提高性能。现有的路由方法通常需要更新模型权重、每个测试实例运行昂贵的搜索循环,或者在推理过程中需要 真值 标签。在这项工作中,我们提出了 Transformer 层的马尔可夫链路由(MACRO),这是一个框架,可以在 LLM 架构上学习特定于任务的路由,而无需修改底层参数。 MACRO 将层路由建模为上下文相关的马尔可夫策略,以层索引、计算预算阶段、方向位移和运算符上下文为条件,支持跳过、重复和剩余隐藏状态加法操作。马尔可夫路线分布通过训练数据的反馈进行更新,并使用 top-k Viterbi 算法进行解码,以隔离高概率的候选程序。我们在多个开放权重 LLM 上跨不同推理和知识基准评估 MACRO。与未布线的基线相比,MACRO 的平均精度提高了 +5.0%,其中小型模型的增益最大。我们比最佳动态路由方法 Dr. LLM 的性能提高了 7.2%,同时将路由搜索时间缩短了 9.4 倍(从 14.8 小时减少到 1.6 小时)。我们的代码可在 https://github.com/Batorskq/MACRO 上公开获取。