开源项目

llama.cpp v0.5.0:LoRA 句柄加载与 UNIX socket 绑定

ggml-org/llama.cpp v0.5.0

AI 基础设施模型服务框架

概述

llama.cpp 是以 C/C++ 为核心的开源大模型推理项目,支持在本地 CPU 和多种加速器上运行模型。 llama.cpp v0.5.0 增加从已打开文件句柄加载 LoRA 的接口,让调用方更灵活地管理适配器文件。服务器支持多个 TCP 地址和 UNIX socket 绑定,并支持工具返回的图像输入。 版本还汇集 SYCL 算子融合、Intel Xe FlashAttention 和 Hexagon HMX/DMA 等后端更新,部分改动此前已在本周 nightly 中提供。