论文
复现PoLar:动态层程序的收益与路由失效
Programs-of-Layers in LLMs through the Lens of Cortical Areas
摘要
LLM 中的推理通常是通过每一层进行固定深度、固定顺序的前向传递,无论输入有多困难。人脑并不是这样工作的:以丘脑为中枢,根据需求灵活地将信息传送到皮层的各个区域。李等人。 (2026)最近通过他们称之为层程序(PoLar)的系统表明,如果Transformer的层被视为函数库而不是固定序列,则可以赋予Transformer类似的灵活性。当每个输入通过跳过或重复的连续层块的自适应序列动态路由时,性能比标准前向传递有所提高。我们比原始论文更详细地重建了 PoLar 的诊断 MCTS,并将其应用于 5 个模型。我们重现了 PoLar 的几项发现:跳跃优于标准传递,重复优于跳跃,并且两者结合优于单独的任何一个。较短的程序足以解决较简单的问题,而较难的问题则需要更多的层重复。然而,我们未能复制有关其用于单次推理的学习路由器的主要主张:其排名最高的预测始终崩溃回标准传递,尽管其 top-k 预测程序确实显示出真正的准确性增益。除了复制之外,我们发现少量的通用程序就足以解决大部分问题。我们还对这些程序的结构和鲁棒性进行了更深入的分析:例如,我们发现纠正错误的程序非常脆弱:即使撤消程序内的单个编辑通常也会破坏纠正。将其与大脑的路由机制连接起来,Polar 反映了类似皮质区域的Transformer层之间丘脑皮质协调的原理。我们在 https://datexis.github.io/RE-PoLar/ 公开发布代码
