开源llama.cpp Releases·原文 2026年9月12日

llama.cpp发布b10922:为OpenCL加入Q4_K A8二值化GEMM内核

该版本新增kernel_gemm_noshuffle_q4_k_f32_32b_trans_ila_a8_bin,针对非MoE的A8 Q4_K场景,并修正了布局兼容性、重命名了二值内核选择辅助函数。

llama.cpp发布构建b10922,变更日志显示该版本为OpenCL后端新增了一个二值化GEMM内核:kernel_gemm_noshuffle_q4_k_f32_32b_trans_ila_a8_bin(PR #28677)。

同一提交还包含两项配套改动:修复布局兼容性,以及重命名二值内核选择辅助函数。改动作者署名为Li He。

新增内核的名字与适用场景

从内核命名可以读出这次改动的落点:noshuffle表示不走shuffle路径,q4_k表示权重采用Q4_K量化格式,f32_32b与trans_ila描述数据布局和转置方式,a8_bin指 8 位激活下的二值化路径。

变更说明明确写出范围是非MoE场景,也就是说这次新增的内核针对的是普通稠密结构模型,而不是混合专家模型。

发布页没有给出这块内核的性能数字、测试模型列表或加速比例,这些维度目前没有可引用的公开数据。

  • 新增内核:kernel_gemm_noshuffle_q4_k_f32_32b_trans_ila_a8_bin
  • 内核归属:OpenCL后端
  • 量化组合:Q4_K权重 + A8激活
  • 明确排除:MoE模型
  • 作者署名:Li He

同一提交的两项配套改动

变更日志列出的第二条是修复布局兼容性,第三条是重命名二值内核选择辅助函数。前者关系到这块内核能否在既有布局下正确接入,后者属于内部命名整理。

发布说明由github-actions[bot] 发布,正文只有这几条改动摘要,没有附带基准测试结果或使用示例。

  • 修复布局兼容性
  • 重命名二值内核选择辅助函数
  • 发布者:github-actions[bot]

b10922随版本一起提供的构建产物

该发布页同时列出了多平台预编译包,覆盖macOS Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework、Ubuntu x64/arm64/s390x(CPU)以及Ubuntu的Vulkan、ROCm 10.0、OpenVINO 2026.3.1、SYCL FP32、SYCL FP16构建。

Windows侧提供CPU x64/arm64、arm64 OpenCL Adreno、CUDA 12.4、CUDA 13.3、CUDA 13.4、Vulkan、OpenVINO 2026.3.1、SYCL与ROCm 10.0等构建;Android只有arm64(CPU)一项。

openEuler的条目在本版本中标记为DISABLED,macOS Apple Silicon的KleidiAI启用版本同样标记为DISABLED,并分别指向PR #23705 与PR #23780。

  • macOS/iOS:Apple Silicon arm64、Intel x64、iOS XCFramework
  • Linux:Ubuntu x64/arm64/s390x CPU,以及Vulkan、ROCm 10.0、OpenVINO 2026.3.1、SYCL构建
  • Windows:CPU、CUDA 12.4/13.3/13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0、OpenCL Adreno
  • Android:arm64 CPU
  • openEuler与macOS KleidiAI版本标记为DISABLED

信息来源

llama.cpp Releases原始来源