llama.cpp b11042发布:新增OpenCL A8 Q6_K非MoE二值内核
该版本为OpenCL后端添加了kernel_gemm_noshuffle_q6_k_f32_32b_trans_ila_a8_bin,并修复了布局兼容性问题。
AI解读:llama.cpp发布b11042版本,这次改动集中在OpenCL后端:新增了一个名为kernel_gemm_noshuffle_q6_k_f32_32b_trans_ila_a8_bin的bin内核,用于A8 Q6_K量化、非MoE结构的矩阵乘法。
对用Adreno GPU跑llama.cpp的人来说,这条更新的直接影响是:Q6_K量化模型在OpenCL上的矩阵乘法多了一条专用路径。不过来源只给出了内核名称和修复项,没有附带性能数字,实际能快多少、对哪些模型有效,需要自己测。
发布页还列出了macOS、Linux、Windows、Android等平台的预编译包,包括新增的Windows arm64(OpenCL Adreno)包。同时说明macOS的KleidiAI启用版和openEuler包处于DISABLED状态。
改的是底层内核,普通用户不需要马上行动;正在Adreno设备上跑Q6_K量化模型、或跟进OpenCL后端的人,可以关注这个内核的实际表现。
llama.cpp发布b11042版本,主要变更为OpenCL后端新增一个bin内核:kernel_gemm_noshuffle_q6_k_f32_32b_trans_ila_a8_bin(PR #28678)。
根据发布说明,该PR包含两项改动:添加A8 Q6_K非MoE二值内核,以及修复布局兼容性。
发布页同时列出各平台预编译包,其中Windows arm64提供OpenCL Adreno构建;macOS Apple Silicon的KleidiAI启用版和openEuler相关包标注为DISABLED。