论文
通过误差控制动力学重新思考循环模型中的状态跟踪
Rethinking State Tracking in Recurrent Models Through Error Control Dynamics
摘要
循环架构中的状态跟踪理论主要关注表达能力:固定架构是否可以在理论上实现一组符号转换规则。我们认为同样重要的是误差控制,即沿着区分符号状态的方向控制隐藏状态漂移的动力学。我们证明,仿射循环网络(一类包含状态空间模型和线性注意力的模型)一旦保留状态表示,就无法纠正状态分离子空间上的错误。因此,实用的仿射跟踪器不会学习鲁棒的状态跟踪;相反,他们学习由累积的状态相关误差控制的有限范围解决方案。我们描述了这种失败的机制,表明只有当累积的类内差异相对于初始类间分离仍然很小时,跟踪才保持可读。我们在组状态跟踪任务上凭经验证明这种故障是可以预测的:当可区分性比率超过经过训练的解码器的可读阈值时,跟踪崩溃。在经过训练的模型中,这个交叉点预测了下游精度失败的范围。这些结果表明,鲁棒的状态跟踪不仅取决于架构的理论表达能力,而且关键取决于其错误控制。