llama.cpp b11115发布:OpenCL新增A8 Q4_K非MoE dp4a二值内核
该版本为OpenCL后端添加了名为kernel_gemm_noshuffle_q4_k_q8_1_dp4a_ila_a8_bin的二进制内核,并重命名了二进制内核选择辅助函数,同时提供覆盖macOS、Linux、Windows、Android等平台的预编译包。
AI解读:这条更新主要面向在OpenCL上跑量化模型的开发者,尤其是使用Q4_K量化权重、希望利用dp4a指令加速矩阵乘的场景。非MoE的限定意味着它不覆盖混合专家模型。
版本 号从b11115的发布页面可以看到,改动只包含上述两项OpenCL相关提交,没有附带性能对比数据,因此加速幅度尚不清楚。
普通用户如果不需要OpenCL路径,这版的可感知变化有限,主要受益者是自行编译或按平台下载预编译包的部署者。
发布页同时列出了macOS、Linux、Windows、Android等平台的预编译产物,其中macOS Apple Silicon的KleidiAI版本标记为DISABLED,openEuler相关产物同样标记为DISABLED。
llama.cpp发布b11115版本。该版本的改动集中在OpenCL后端,新增一个名为kernel_gemm_noshuffle_q4_k_q8_1_dp4a_ila_a8_bin的二进制内核,并重命名了二进制内核选择的辅助函数。
根据发布说明,新增内核的提交描述为“opencl: add A8 Q4_K non-MoE dp4a binary kernel”,即面向A8场景、针对Q4_K量化的非MoE dp4a二值内核。另一条提交“opencl: rename binary kernel selection helpers”负责重命名相关辅助函数。
发布页同时提供了各平台预编译产物链接,覆盖macOS/iOS、Linux、Android、Windows和openEuler,以及一个独立的UI包。
预编译产物覆盖范围与可用状态
发布页按平台列出预编译包。macOS/iOS包含macOS Apple Silicon (arm64)、macOS Intel (x64) 和iOS XCFramework三 项,其中macOS Apple Silicon的KleidiAI enabled版本标记为DISABLED,并指向PR 23780。
Linux侧包含Ubuntu x64 (CPU)、arm64 (CPU)、s390x (CPU)、Vulkan、CUDA 12(12.8)、CUDA 13(13.4)、ROCm 10.0、OpenVINO 2026.4,以及SYCL FP32与FP16,另外还有面向Snapdragon的Linux arm64包,覆盖CPU、Adreno GPU和Hexagon NPU。
Android提供arm64 (CPU) 与arm64 (Snapdragon: CPU, Adreno GPU, Hexagon NPU) 两个包。Windows提供x64/arm64 CPU、arm64 OpenCL Adreno、CUDA 12(12.4)与CUDA 13(13.4)、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0等版本。openEuler的x86与aarch64产物(310p、910b ACL Graph)均标记为DISABLED,并指向PR 23705。
- 新增OpenCL内核:kernel_gemm_noshuffle_q4_k_q8_1_dp4a_ila_a8_bin
- 提交说明将其描述为A8 Q4_K non-MoE dp4a二值内核
- 另一项改动为重命名二进制内核选择辅助函数
- macOS Apple Silicon KleidiAI版本与openEuler产物标记为DISABLED
- Linux、Windows、Android等多平台提供预编译包及独立UI包