论文

超越深度截断:递归语言模型深度利用的受控评估

Beyond Depth Truncation: Controlled Evaluation of Depth Utilization in Recursive Language Models

模型评测评测方法与指标

摘要

深度递归语言模型反复应用一小组层,将每Token计算量与不同参数的数量解耦。为判断模型是否真正利用深度,递归和层剪枝研究都依赖一种共同评价:在推理时截断深度,绘制质量与保留深度比例的关系,并读取斜率。该指标便宜且无需训练,却存在未经检视的缺陷:它从同时改变多个模型属性的干预中提取单一标量。深度截断同时减少模块应用次数、减少不同计算的总量,并把读出头置于分布外残差流上。所观测斜率混合三个因素,却通常只被解释为第二项。我们提出深度控制协议DCP,用诊断套件分离这三个量。DCP包含三项正向对照,在改变其他因素时隔离各因素;一项负向对照将相同干预施加于稠密Transformer,确保效应不是测量协议的产物;以及一项受控训练干预来验证因果性。关键对照在仅执行一次不同迭代的同时,使用全部模块应用预算;它严格来说只能在沿深度共享权重的架构中实现,因为稠密网络中重复某层会产生完全不同的模型,而不是同一模型的另一种配置。