llama.cpp b11097为OpenCL加入A8 Q4_0非MoE dp4a二值核
该版本唯一列出的代码变更是PR #29055 新增的OpenCL内核,面向非MoE模型的A8激活与Q4_0权重量化组合,并在Windows arm64 OpenCL Adreno等平台上提供预编译产物。
AI解读:A8指 8 位激活,Q4_0是权重量化格式,dp4a是整数点积指令。这个核只面向非MoE模型,属于定点落地场景的优化,而不是通用推理能力升级。
给带Adreno GPU的Windows arm64设备和其他OpenCL环境预编译了二进制,省去自己编译。不过能带来多少实际加速,发布说明没有给出测试数据。
llama.cpp发布b11097版本,该版本发布说明中列出的唯一代码改动,是在OpenCL后端新增了一个A8 Q4_0非MoE的dp4a二值核,对应拉取请求 #29055。发布说明由github-actions[bot] 生成。
从命名看,这个内核针对A8激活(8 位)、Q4_0权重量化,并使用dp4a整数点积指令;限定条件是“非MoE”,即不适用于混合专家模型。发布说明没有提供性能数据、支持矩阵或精度说明。
b11097的OpenCL新增A8 Q4_0非MoE dp4a核
发布说明把“opencl: add A8 Q4_0 non-MoE dp4a binary kernel (#29055)”列为该版本的条目。A8表示激活使用 8 位,Q4_0是一种 4 位权重量化格式,dp4a是常用于低精度推理的整数点积指令。
“非MoE”限定了适用模型范围:混合专家模型不适用。发布说明没有展开这个核的触发条件、加速幅度或精度影响,因此这些维度无法从该来源确认。
预编译产物的平台覆盖
发布说明列出的下载产物覆盖多个平台。与OpenCL直接相关的一项,是Windows arm64的OpenCL Adreno构建(二进制包名为llama-b11097-bin-win-opencl-adreno-arm64.zip)。其余包括macOS Apple Silicon与Intel、iOS XCFramework、Ubuntu x64/arm64/s390x的CPU构建,以及Ubuntu和Windows的Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL等构建,另有Android arm64 CPU构建和UI包。
- Windows arm64 OpenCL Adreno:llama-b11097-bin-win-opencl-adreno-arm64.zip
- macOS Apple Silicon arm64与Intel x64,iOS XCFramework
- Ubuntu x64/arm64/s390x(CPU)、Ubuntu Vulkan x64/arm64、Ubuntu ROcM 10.0 x64、Ubuntu OpenVINO 2026.4 x64、Ubuntu SYCL FP32/FP16 x64
- Ubuntu与Windows的CUDA 12.8/12.4及CUDA 13.4构建,并分别附带对应的CUDA运行库
- Windows CPU x64/arm64、Windows Vulkan x64、Windows OpenVINO 2026.4 x64、Windows SYCL x64、Windows ROCm 10.0 x64
- Android arm64 CPU;UI包
被标记为DISABLED的条目
发布说明中,macOS Apple Silicon arm64的KleidiAI启用版链接到PR #23780,并被标记为DISABLED;openEuler下包括x86(310p)、x86(910b,ACL Graph)、aarch64(310p)、aarch64(910b,ACL Graph)在内的条目均标注DISABLED,关联PR #23705。
这些平台当前不提供下载,是发布说明中明确的状态。