开源项目

llama.cpp b11227:避免图像输入切换注意力时重复预留

ggml-org / llama.cpp b11227

模型推理推理加速

概述

llama.cpp 是本地模型推理项目,为开发者提供模型加载、计算后端和服务接口,适用于在不同硬件上运行语言及多模态模型。 b11227 调整上下文管理,在切换 causal_attn 状态时不再重复预留调度器资源。 这项变化针对图像输入等需要切换注意力状态的处理流程,减少状态切换时重复组织资源的步骤。