开源项目

moe-l2创建仓库:低显存GPU运行百亿级MoE模型的专家卸载代理

yalun753/moe-l2

模型推理推理加速

概述

moe-l2解决低显存GPU跑MoE大模型的加载与执行问题:以一个透明、OpenAI兼容的代理服务,按提示内容预测需要激活的专家并做显存卸载,让10-11GB显存的消费级显卡运行DeepSeek、Qwen、Mixtral等100B+参数的MoE模型,带CI与中英文文档。仓库(仓库创建日,非功能发布日)。想在本地跑大MoE模型但显存受限的开发者可直接试用其代理方案;专家预测 miss 会引入额外加载开销,实际吞吐与首token延迟需对照显存更大的基线方案评估。