开源项目
llama.cpp b11163:llama_batch_ext 统一批次接口
ggml-org/llama.cpp b11163
概述
llama.cpp 是以 C/C++ 为核心的开源大模型推理项目,支持在本地 CPU 和多种加速器上运行模型。 llama.cpp b11163 增加 llama_batch_ext,将 Token、embedding 和 state 输入组织到同一批次接口中,减少调用侧处理多种输入形式的差异。 版本提供批次解码演示和兼容性测试,属于既有推理引擎的接口更新。接入团队应对照新接口检查批次构建与解码调用,不把接口统一直接视为性能提升。