开源llama.cpp Releases·原文 2026年9月28日

llama.cpp b11232发布:x86 CPU为非常规头维度启用分块Flash Attention

该版本将分块Flash Attention扩展到head dim不是向量整数倍的模型,并为simd_gemm_ukernel_tail增加AVX2掩码加载/存储支持,同时修复填充KV分块的FA softcap处理。

AI解读:这条更新解决的是一个很具体的兼容性问题:在x86 CPU上,Flash Attention的分块实现此前对head dim有“必须是向量整数倍”的限制,b11232把它打开到非常规头维度,意味着一些原本走不到这条快路径的模型现在可以用上。

对跑本地推理的人来说,这类底层改动的价值通常不在数字上,而在于“能不能用”和“用哪个后端”:CPU路径的覆盖范围变宽,受影响的模型少了一个绕开的理由。

版本照例附带macOS、Linux、Windows、Android等平台的预编译包,涉及Vulkan、CUDA、SYCL、OpenVINO、ROCm等多个后端;同一个提交还包含AVX2掩码加载/存储支持和softcap修复,但发布说明没有给出具体性能数字,实际收益需按模型和硬件自行验证。

llama.cpp发布b11232版本,主提交为“ggml-cpu: enable tiled flash attention for non-vector-multiple head dims on x86 (#29423)”。

该提交让x86 CPU上的分块Flash Attention支持head dim不是向量整数倍的情况。

同一提交还包含两项改动:为simd_gemm_ukernel_tail增加AVX2的掩码加载与存储支持;修复填充KV分块的FA softcap处理。

版本附带Web界面,以及macOS/iOS、Linux、Android、Windows等平台的多后端预编译包,包括CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16等。

发布说明未给出性能数据或受影响的模型清单;KleidiAI版macOS Apple Silicon构建和openEuler构建标记为DISABLED。

信息来源

llama.cpp Releases原始来源