开源llama.cpp Releases·原文 2026年9月26日

llama.cpp b11189为OpenCL新增两个Q5_K A8二值化矩阵乘内核

该版本由Li He合入 #29401:新增非MoE、非dp4a与dp4a两条二值化GEMM内核,并修正二值化内核中s仅在其上转置的问题。

AI解读:两个内核分别是非dp4a路径的kernel_gemm_noshuffle_q5_k_f32_32b_trans_ila_a8_bin,以及dp4a路径的kernel_gemm_noshuffle_q5_k_q8_1_dp4a_ila_a8_bin。PR描述同时说明这两个内核面向非MoE场景,并修复了s转置:s仅在二值化内核中进行转置。

这批改动只涉及OpenCL后端的算子实现,发布页没有公布性能对比、精度结果或基准数据;实际收益取决于设备与驱动是否走到对应内核路径。编译自己版本的用户需要重新构建才能用上这两条内核,直接下载官方二值化的则已包含该提交。

目前证据只有版本说明和PR摘要,没有测试数据支撑“提速多少”的结论,也无法判断对其他后端是否有影响。对OpenCL端侧推理有需求的开发者可以检查自己的模型是否命中Q5_K量化与对应内核条件,其他人短期内无需行动。

llama.cpp发布构建b11189,本次唯一列出的代码变更是为OpenCL后端新增两个Q5_K二值化矩阵乘(GEMM)内核,PR编号 #29401,作者为Li He。

两个新增内核分别是kernel_gemm_noshuffle_q5_k_f32_32b_trans_ila_a8_bin与kernel_gemm_noshuffle_q5_k_q8_1_dp4a_ila_a8_bin,后者走dp4a路径。

PR描述标注这两个内核面向非MoE场景,并附带一处转置修正:s仅在二值化(bin)内核中进行转置。

信息来源

llama.cpp Releases原始来源