论文

巩固-扩展算子机制:自适应学习的统一框架

Consolidation-Expansion Operator Mechanics:A Unified Framework for Adaptive Learning

模型推理测试时计算扩展

摘要

每个自适应学习系统都必须在两种操作之间交替:巩固已知的知识并扩展到新的证据。我们提出 \emph{Consolidation-Expansion Operator Mechanics} (OpMech),一个使这种结构变得精确的框架。中心对象是\emph{order-gap} $\Ogap(θ; e)$,即合并算子~$Q$和扩展算子~$P_e$在给定知识状态下无法交换的程度。由于阶差是可以根据系统自身的轨迹计算出来的,因此它可以作为一个实时控制信号:大的值表明系统对整合和扩张的顺序仍然敏感;一旦订单差距缩小并保持较小,进一步的处理就不太可能改变结果。三个结果给出了信号的精确含​​义:阶隙沿着收敛轨迹衰减;持续较大的订单缺口意味着系统远未达到稳定状态;基于阶差的停止规则在无噪声和有界噪声设置中都具有可证明的保证。该框架适用于五个领域:强盗、强化学习、随机优化、持续学习和递归语言模型。我们给出了在三种代表性情况下阶差可靠地跟踪收敛的条件。我们详细开发了递归语言模型应用程序,展示了 OpMech 如何用有原则的、证据驱动的替代方案取代启发式停止规则和固定递归预算。