开源项目
MoE4All:让游戏显卡运行超显存容量MoE大模型的Windows本地推理工具
Headmaster218/MoE4All
概述
MoE4All面向想在消费级显卡上本地运行大模型的个人用户与小团队。程序仅13MiB,下载GGUF并选自动配置即可本地聊天,或经OpenAI兼容接口接入现有客户端;核心思路是让显存、内存与SSD协同加载MoE专家权重,兼容AMD、NVIDIA、Intel显卡。0.8.0版实测:RX 7900 XTX 24GiB加64GiB DDR4、激进性能档下,Qwen3.6-35B-A3B 20K输入65.6 tok/s、150K输入39.9 tok/s;Qwen3.8-Flash-Next开启MTP后为60.2与48.1 tok/s。官方建议直接使用其优化量化文件:35B本体为单个GGUF,Flash-Next含33个分片,视觉与MTP文件单独下载、向导中选择。