开源项目

llama.cpp b11206:Hexagon后端更新

ggml-org/llama.cpp b11206

AI 基础设施模型部署

概述

llama.cpp 是以 C/C++ 为核心的开源大模型推理项目,支持在本地 CPU 和多种加速器上运行模型。 llama.cpp b11206 扩展 Hexagon 后端的采样能力,加入 STEP、SUM 和 ARGMAX 等操作,并更新 CPY 以覆盖采样场景。 版本还处理大规模 logits 的分块计算、扩展缓冲区中的标量和广播索引问题,整理采样及二元操作的 DMA 使用,并修复性能退化。发布说明没有给出统一性能对照,使用该后端的团队需要在自己的模型和设备上验证。