llama.cpp构建b11175为Hexagon NPU加入Q5_K量化类型支持
变更日志显示,该版本在Hexagon后端新增Q5_K量化类型,同时继续发布覆盖macOS、iOS、Linux、Android、Windows和openEuler的多平台预编译包,其中KleidiAI版macOS构建与openEuler构建仍处于禁用状态。
AI解读:这次llama.cpp的b11175构建只做了一件事被写在发布标题里:在Hexagon后端加入Q5_K量化类型支持。对骁龙设备用户来说,Q5_K是一种介于Q5_0和Q6_K之间的 5 比特量化选项,支持它意味着模型选择清单里多了一种压缩率与精度折中的可能。
但要注意,发布页没有给出Q5_K在Hexagon上的速度、内存或精度实测数据。能确认的只是代码路径被接入了,不是性能已经变好。真正用骁龙NPU跑本地模型的人可以等后续基准或自己测,普通用户没必要因为这个版本号立刻升级。
同一版本仍在正常产出多平台预编译二进制,包括带Hexagon NPU的Linux arm64与Android arm64骁龙包。这说明该项目的发布节奏是版本号持续滚动,单次构建的新闻价值集中在变更本身,而不是一次大规模平台调整。
llama.cpp发布构建版本b11175,发布标题写明本次变更为“hexagon: add q5_k quant type support”,即在Hexagon后端新增Q5_K量化类型支持,对应PR编号 #29123。
本次构建包含的量化类型变更与预编译产物范围
GitHub上的llama.cpp Releases页面由github-actions[bot] 发布b11175,发布说明的标题即变更内容:为Hexagon添加q5_k量化类型支持,指向pull request #29123。发布页未附上性能、精度或内存占用的测试数据。
该版本同时提供多平台预编译包。macOS/iOS方向包括macOS Apple Silicon(arm64)与macOS Intel(x64)二进制、iOS XCFramework,其中标注KleidiAI enabled的macOS Apple Silicon构建处于DISABLED状态,链接指向PR #23780。
Linux方向提供Ubuntu x64/arm64/s390x的CPU构建,以及Vulkan、CUDA 12(12.8)、CUDA 13(13.4)、ROCm 10.0、OpenVINO 2026.4、SYCL FP32与SYCL FP16的x64构建,并单独提供CUDA 12.8与CUDA 13.4的运行时库压缩包;Linux arm64另有骁龙包,覆盖CPU、Adreno GPU与Hexagon NPU,并附有安装指南链接。
Android方向提供arm64 CPU包与骁龙包(CPU、Adreno GPU、Hexagon NPU),同样附安装指南。Windows方向覆盖x64/arm64 CPU、arm64 OpenCL Adreno、CUDA 12(12.4)、CUDA 13(13.4)、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0,并附带CUDA 12.4与CUDA 13.4的DLL包。openEuler方向的四个构建均标记为DISABLED,链接指向PR #23705,列出openEuler x86 310p、openEuler x86 910b(ACL Graph)、openEuler aarch64 310p与openEuler aarch64 910b(ACL Graph)。此外发布页还有单独的UI压缩包。