论文

JustFit:在24GiB笔记本上通过即时状态管理服务20万Token上下文

JustFit: 200K-Token LLM Serving on a 24 GiB Laptop with Just-in-Time State Management

AI 基础设施模型服务框架

摘要

能力较强的开放权重模型使本地编码和推理有吸引力,但上下文与执行状态给笔记本内存带来压力。我们提出基于MLX的JustFit运行时,结合压缩KV执行KVExec、组件驻留PhaseSwap和保状态服务切换StateTrans。这些机制融合重建,协调即时实体化与释放,独立于模型权重量化。在24GiB M4 Pro MacBook上运行Qwen3.8-27B MXFP4的完整执行容量测试中,三次独立运行完成196608个输入和16384个输出token,使已完成单请求上下文从mlx-vlm基线30720位置提升到212992,增加6.93倍;另一项双请求运行共保留229376位置。在独立性能测试中,32K输入、64输出探针达到每秒19.11token,重复32K+6K工作负载的峰值进程占用中位数为16374MiB。集成运行时正确回答30道AIME 2026题中的29道,展示紧凑状态与生命周期感知执行如何在支持长生成推理的同时扩大本地服务容量。