开源llama.cpp Releases·原文 2026年9月23日本站收录 2026年9月24日

llama.cpp发布b11118:为HVX FA mask处理引入直接映射DMA缓存

该版本的主要变更是hex-dma引入direct-mapped DMA cache,发布说明称其更适合HVX FA mask处理,同时提供macOS、Linux、Android、Windows等多平台预编译包。

AI解读:Hexagon HVX是高通骁龙芯片上的向量加速单元,llama.cpp近年一直在为骁龙CPU、Adreno GPU和Hexagon NPU提供后端支持。这次改动落在DMA缓存策略上,属于该后端内部的搬运效率问题。

对使用骁龙设备跑本地模型的开发者来说,这类底层改动不改变接口,但是否带来实际速度或内存收益,发布说明没有给出数据,需要自行用b11118与前一版本对比。

llama.cpp发布b11118版本,主要变更是在hex-dma中引入直接映射(direct-mapped)DMA缓存。发布说明写明,这种缓存更适合HVX FA mask处理(#29282)。

该版本按惯例附带多平台预编译包:macOS Apple Silicon(arm64)与macOS Intel(x64)、iOS XCFramework;Linux侧提供Ubuntu x64/arm64/s390x的CPU包,以及Vulkan、CUDA 12(x64)、CUDA 13(x64/arm64)、ROCm 10.0(x64)、OpenVINO、SYCL FP32/FP16(x64)等后端包。

面向移动端,发布了Android arm64的CPU包,以及Android arm64的Snapdragon包(含CPU、Adreno GPU、Hexagon NPU),并附Snapdragon设置指南;Linux arm64也有对应的Snapdragon包(CPU、Adreno GPU、Hexagon NPU)。

Windows侧提供x64与arm64的CPU包、arm64的OpenCL Adreno包、x64的CUDA 12、CUDA 13、Vulkan、OpenVINO、SYCL、ROCm 10.0包,以及arm64的CUDA 13包,CUDA包另附对应版本的DLL压缩包。

发布说明中还列出UI包。macOS Apple Silicon的KleidiAI构建被标记为DISABLED,并指向PR #23780;openEuler构建同样被标记为DISABLED,指向PR #23705,涉及openEuler x86的 310p、910b(ACL Graph)以及aarch64的 310p、910b(ACL Graph)。

hex-dma改动针对HVX FA mask处理

发布说明对b11118的描述只有一句:hex-dma引入直接映射DMA缓存,该缓存更适合HVX FA mask处理(#29282)。

HVX指高通Hexagon向量扩展,llama.cpp的Snapdragon后端同时使用CPU、Adreno GPU和Hexagon NPU。

发布说明没有给出这一改动的性能数据、适用模型或内存占用变化。

信息来源

llama.cpp Releases原始来源