开源项目

llama.cpp b11307:修正推测解码层输入与NextN状态

b11307

AI 基础设施模型服务框架

概述

llama.cpp的推测解码利用草稿预测减少主模型计算。b11307保留层输入的原始批次顺序,并恢复NextN所需的未掩码状态,修正相关模型的草稿输入路径。使用受影响模型的部署可更新版本并验证输出。发布日志同时将部分回归测试、WebGPU/OpenVINO及NextN相关工作列为后续事项,不能将这些待完成内容当成当前版本已全面验证。