开源项目

llama.cpp b11293/b11292:扩展BF16算子并明确后端回退

b11293

AI 基础设施模型服务框架

概述

llama.cpp支持多种精度和计算后端。b11293与b11292连续扩展BF16路径:前者涉及单目、GLU、二元和缩放算子,后者为CPU矩阵乘中的BF16第二输入扩宽为浮点计算。OpenVINO仍拒绝BF16缩放和混合ADD/MUL/SUB;Vulkan不满足输入条件时拒绝并安排CPU回退。使用者应升级对应版本并按实际算子、输入类型和设备检查支持范围,不能仅依据BF16标签假设全后端可用。