论文
动态路由作为测试时的新维度LLM的多功能性
Dynamic Routing as a New Dimension for Test-time Versatility of LLMs
摘要
除了扩展参数和数据之外,大语言模型目前还沿着单一轴获得了解决新问题的多功能性:他们在思维链 (CoT) 上花费了token。我们研究执行模型层的子集或迭代其中一些层的动态路由程序是否可以打开测试时适应的第二个轴,与 CoT 互补并且无需任何梯度更新。之前的工作表明,此类计划确实存在,并且可以在解决与他们接受培训的问题类似的问题时带来准确性和效率提升;我们询问是否也可以通过在没有训练的情况下跨模型和任务转移的策略,从少量演示(3 或 10 个)中快速识别它们。首先,我们发现,根据分配给演示标签的概率(由模型自身的置信度进行仲裁)来选择程序的策略会带来一致的收益:平均而言,在 MMLU 的 49 项任务中,尤其是在 7 个模型中的 4 个中,尤其是在 ARC-AGI 等远离分布的任务中,程序将 CoT 失败的 7B 模型的准确性提高了一倍。其次,在跨七个训练后模型的 MMLU 上,路由在实践中补充了 CoT:两者在不同的查询上取得了成功,并且它们的组合超过了单独的 CoT。尽管取得了这些成果,我们的分析表明,基于置信度的选择仍有很多潜力尚未开发,特别是在两个地方:(1)在训练之前的早期就已经存在的路由潜力浮出水面,但在后训练之后变得更难选择,(2)使模型对路由引入的细化具有鲁棒性,因为不成功的路由往往会将剩余流驱离后续层期望的分布。总之,我们的结果表明动态路由可以作为扩展现有和未来LLM在快速测试时适应中的可塑性的范例。