开源项目llama.cpp b11324:减少直接I/O加载时的张量复制b11324ggml-org·来源日期:2026.10.01AI 基础设施推理服务收藏概述llama.cpp在模型加载和映射过程中支持不同I/O路径。b11324修改llama-mmap,避免direct-io模式对每个张量执行第二次完整大小复制,减少该路径上的重复搬运。用户可采用对应构建,并在自己的存储、模型大小和加载参数下比较启动时间及峰值内存。发布说明没有提供量化测量,也不说明其他加载方式具有相同改善。