论文

LAWS:从实际工作负载中象征性地学习——用于神经推理、机器人和边缘部署的自我认证参数化缓存架构

LAWS: Learning from Actual Workloads Symbolically -- A Self-Certifying Parametrized Cache Architecture for Neural Inference, Robotics, and Edge Deployment

模型推理推理加速

摘要

我们引入了 LAWS(象征性地从实际工作负载中学习),这是一种自认证推理缓存架构,可根据部署观察构建不断增长的经过认证的专家函数库。每个专家覆盖由基本模型的概率语言特里树 (PLT) 中的节点定义的输入空间区域,并携带在所有输入上统一保持的形式错误界限。中心结果是一个自证明定理:对于任何输入 x,LAWS 近似误差以 epsilon_fit + 2*Lambda(W)*C_E 为界,其中 Lambda(W) 是模型 Lipschitz 常数,C_E 是最大嵌入直径,epsilon_fit 是专家训练误差——所有这些都可以在部署时检查,无需 真值。我们证明 LAWS 将专家混合和 KV 前缀缓存概括为特殊情况,并且严格来说比任何固定 K MoE 或有限缓存更具表现力。进一步的结果包括单调命中率定理(任意匹配路由确保覆盖范围只会增加)、O(2^H log N) 的专家库增长率(其中 H 是工作负载熵)、K 单元队列的 Omega(K) 加速的队列学习收敛定理以及无线更新带宽限制。我们推测 LAWS 在固定在线缓存算法中是获取最优的,并且训练分布上的有效 Lipschitz 常数在深度上呈多项式增长,而不是呈指数增长。应用程序是为 LLM 推理、机器人控制和多代理边缘部署而开发的。