开源项目

Meld Turbo 公开单机 Mac MoE 推测解码与 Metal 补丁

A 125B-parameter model, fully local, on a MacBook: Qwen3.8-Flash-Next at ~45 tok/s on Apple silicon.

概述

Meld Turbo 是在Apple Silicon上运行Qwen3.8-Flash-Next的首个公开工程版本:模型总参125B、每token激活6B,以llama.cpp/Unsloth MTP分支的固定版本为底座,附12项补丁、稠密张量重编码脚本、词表与API测量工具。工程采用MIT,模型权重及第三方材料各有许可。它用模型自己的MTP头提出草稿,主模型一次验证多个token;把草稿词表从248K缩到覆盖英文、代码与CJK的106K,并将稠密低比特张量重编码成Q8_0,专家权重原字节保留,缓解Metal小批次验证的整数ALU瓶颈。使用需Max级或以上Apple GPU、macOS工具链和约110GB空余磁盘,下载指定GGUF与MTP头、运行setup及重编码后,以serve提供OpenAI-compatible本地API。作者在M2 Max 96GB报告约40—47token/s,128K上下文、约45—48GB内存;长期负载会降速。64GB条件是在96GB机器限制GPU内存并锁住32GiB的模拟,尚缺真实64GB设备确认;长提示词吞吐和持续负载另有较低结果。重编码对原量化模型的KLD与短任务一致性不代表相对BF16质量,2bit专家的实际任务质量仍未评估。