开源llama.cpp Releases·原文 2026年9月15日

llama.cpp b10982为Vulkan后端加入稀疏Flash Attention,支持DSV4/GLM

该版本在Vulkan后端新增稀疏Flash Attention支持,面向DSV4与GLM模型;同时包含实现调优、测试、规避非确定性atomicAdd、新增cm2 decode向量支持等改动。

llama.cpp发布b10982版本,提交说明为“vulkan: support sparse Flash Attention (#28105)”。

该版本在Vulkan后端加入稀疏Flash Attention支持,面向DSV4与GLM模型。

同一提交还包含:调优实现、添加测试、避免非确定性的atomicAdd、增加cm2 decode向量支持、简化逻辑并统一变量命名、为decode向量增加cm2 f16vec4绑定。

b10982附带的构建产物

发布页列出了各平台的预编译包,包括macOS Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework,以及Linux、Android、Windows、openEuler等平台的对应构建。

Linux侧提供Ubuntu x64/arm64/s390x(CPU)、Vulkan(x64、arm64)、CUDA 12.8与CUDA 13.3(x64、arm64)、ROCm 10.0、OpenVINO、SYCL FP32/FP16等版本;Windows侧提供CPU、OpenCL Adreno、CUDA 12.4/13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0等版本,另有UI包。

macOS Apple Silicon的KleidiAI启用版本被标记为DISABLED;openEuler相关构建同样被标记为DISABLED。

信息来源

llama.cpp Releases原始来源