开源项目

llama.cpp固定微批采样图拓扑,修复禁止重分配构建中的服务中止

llama.cpp b11530

AI 基础设施模型推理投机采样推理服务

概述

llama.cpp b11530修复后端采样的图构建一致性。原实现中reserve按最大输出数构建采样链,而decode按实际输出行数构建,导致图拓扑及输出缓冲区需求变化;在禁止重新分配的构建中,连续同规模微批仍可能触发unexpected graph reallocation并中止。 新实现为每个采样器始终构建相同数量的采样链,把没有实际输出的链放在padding行且不选择输出,reserve与decode共享构建逻辑。一般默认及没有投机解码的服务中n_outputs_max_per_seq仍为1,通常图不变。维护者在CUDA、GGML_SCHED_NO_REALLOC=ON下确认原失败的草稿KV检查测试通过;开启和关闭后端采样的服务测试各417项通过,Qwen3 0.6B Q4_0采样器测试18项通过。