论文

更智能、更便宜:字节精确的 KV 缓存移植将冻结的小模型变成经过验证的知识飞轮

Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel

模型推理KV Cache

摘要

我们报告了一种方法,可以在不改变任何权重的情况下,使冻结的小语言模型变得更强大,并且成本大大降低。经过验证的知识作为字节精确的键值 (KV) 状态工件存储一次,然后通过移植恢复到新的推理上下文中。恢复是位精确的:在固定的确定性配置下,嫁接的 logits 与新计算(SHA-256 相等)逐字节相同,在 50 个样本上具有零 KL 散度和 100% argmax 一致性。我们证明,自身位置移植是具有浮点旋转编码的模型上唯一的数值精确操作点,并且我们在两个模型尺度(12B、31B)和两个 GPU 目标(其中一个通过预注册重放)上验证字节精确性。在 AIME 2025 上,一旦嫁接经过验证的解决方案库,冻结的 Gemma-4-12B 就会从 80.0% 上升到 93.3%,高于其自己的 77.5% 和其 31B 兄弟的 89.2% 已发布的锚点。在重复出现的情况下,基础模型在 401,026-词元预算 中从未解决的八个问题是通过缓存的经过验证的解决方案在 61 个解码词元中得到答案,词元减少了 6,574 个因子,能量减少了约 8,700 倍;能力声明完全依赖于保留的转移(31B 中的 7 中的 7)。相同的字节精确存储在零额外加速器内存下将可用上下文从 32,768 个词元扩大到 2,854,766 个词元,并在相同架构的机器之间移动字节相同。我们在行为层面描述系统;该引擎是专有的,每个报告的数字都由提交的输入和输出哈希值支持,因此无需它即可重新检查评分。