论文

Apple~Silicon 上波兰语模型的跨系列 推测解码:使用 UAG 扩展 MLX-LM 对 Bielik~11B 进行实证评估

Cross-Family Speculative Decoding for Polish Language Models on Apple~Silicon: An Empirical Evaluation of Bielik~11B with UAG-Extended MLX-LM

模型推理投机采样

摘要

推测解码 通过使用小型草稿模型提出 k 个候选标记供目标模型验证来加速 LLM 推理。虽然对于高带宽 GPU 上的相同分词器对有效,但其对具有不匹配分词器和消费级统一内存的跨系列对的适用性仍未得到充分探索。我们使用通用辅助生成 (UAG) 扩展了 MLX-LM 框架,以在 Apple Silicon 上启用交叉标记器 推测解码。我们评估 Bielik 11B-Instruct(基于 Mistral)作为目标模型,并与三个草案模型配对:Bielik 1.5B(基于 Qwen,带有自定义标记器)、Qwen2.5-1.5B 和 Llama 3.2-1B。在三个波兰语数据集(Wikipedia、pl_alpaca、synthetic)上进行的实验使用 {2,4,6} 中的草稿长度 k 来比较朴素和上下文感知的标记翻译。结果显示:(1) 上下文感知翻译持续提高所有配置的接受率; (2) 波兰专用的 Bielik 1.5B 的接受度低于通用的 Qwen2.5 和 Llama 3.2 绘图仪; (3) Apple Silicon 上的吞吐量取决于内容,对于结构化文本达到 1.7 倍的加速,但对于各种指令则失败; (4) 统一内存的验证成本不会像理论预测的那样摊销,因为两种模型都受到内存带宽的限制,使得顺序起草相对于批量验证来说成本高昂。我们提出了一个硬件感知加速公式,并描述了 Apple Silicon 上跨系列 推测解码 的条件。这是对波兰LLM跨家族推测解码的首次系统评估,也是对统一内存架构上基于UAG的解码的首次实证研究。