llama.cpp b10982为Vulkan后端加入稀疏Flash Attention,支持DSV4/GLM
该版本在Vulkan后端新增稀疏Flash Attention支持,面向DSV4与GLM模型;同时包含实现调优、测试、规避非确定性atomicAdd、新增cm2 decode向量支持等改动。
llama.cpp发布b10982版本,提交说明为“vulkan: support sparse Flash Attention (#28105)”。
该版本在Vulkan后端加入稀疏Flash Attention支持,面向DSV4与GLM模型。
同一提交还包含:调优实现、添加测试、避免非确定性的atomicAdd、增加cm2 decode向量支持、简化逻辑并统一变量命名、为decode向量增加cm2 f16vec4绑定。
b10982附带的构建产物
发布页列出了各平台的预编译包,包括macOS Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework,以及Linux、Android、Windows、openEuler等平台的对应构建。
Linux侧提供Ubuntu x64/arm64/s390x(CPU)、Vulkan(x64、arm64)、CUDA 12.8与CUDA 13.3(x64、arm64)、ROCm 10.0、OpenVINO、SYCL FP32/FP16等版本;Windows侧提供CPU、OpenCL Adreno、CUDA 12.4/13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0等版本,另有UI包。
macOS Apple Silicon的KleidiAI启用版本被标记为DISABLED;openEuler相关构建同样被标记为DISABLED。