开源项目
llama.cpp b11223:因果重排模型允许分块预填充
ggml-org / llama.cpp b11223
概述
llama.cpp 是本地模型推理项目,为开发者提供模型加载、计算后端和服务接口,适用于在不同硬件上运行语言及多模态模型。 b11223 允许 Qwen3、Qwen3-VL 等因果重排模型对 RANK pooling 输入进行分块处理,解除相关输入受 n_ubatch 限制的问题。 长文档重排可以据此分块组织输入;双向交叉编码器仍需要完整物理批次,不能将两类模型按同一方式配置。