开源项目

OSCAR:2比特KV缓存论文方法的官方实现

FutureMLS-Lab/OSCAR

模型推理KV Cache

概述

OSCAR 是 FutureMLS-Lab 发布的官方实现仓库,对应论文提出的2比特KV缓存压缩方法。KV缓存是长上下文推理中显存占用的主要来源,把键值量化到2比特可大幅降低显存开销,进而提升可服务的上下文长度或并发量;官方实现的价值在于提供与论文对齐的可复现基线。做长文本推理或高并发部署的团队可据此评估接入自有推理栈的可行性。模型适配范围需在仓库确认。