开源llama.cpp Releases·原文 2026年9月20日

llama.cpp b11062为Qwen4在CUDA上启用稀疏Flash Attention

该版本的核心改动是一条提交:在CUDA后端为Qwen4启用稀疏FA(#28770)。同步发布macOS、Linux、Windows、Android等平台的预编译包。

llama.cpp发布构建b11062,唯一的功能性改动是一条已合并的提交:CUDA后端为Qwen4启用稀疏Flash Attention(sparse fa),对应PR #28770。

该构建同时提供各平台的预编译产物,包括macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework、Linux(Ubuntu x64/arm64/s390x,以及Vulkan、CUDA 12.8、CUDA 13.3、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16等变体)、Android arm64、Windows(CPU x64/arm64、OpenCL Adreno arm64、CUDA 12.4/13.4、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0)以及UI包。

b11062只改了一件事:CUDA上的Qwen4稀疏FA

提交说明为“CUDA: enable sparse fa for qwen4 (#28770)”,即针对Qwen4模型在CUDA后端启用稀疏Flash Attention。发布页没有附带性能数据、显存占用对比或适用条件说明。

两个被标记DISABLED的构建变体

发布页中,macOS Apple Silicon(arm64)的KleidiAI启用版本标记为DISABLED,指向PR #23780;openEuler相关条目同样标记为DISABLED,指向PR #23705,其下x86(310p)、x86(910b,ACL Graph)、aarch64(310p)、aarch64(910b,ACL Graph)四个变体未提供下载。

信息来源

llama.cpp Releases原始来源