llama.cpp b11215发布:为 40-112 头维度调优CUDA fp16 FlashAttention配置
llama.cpp新版本b11215的唯一功能变更是针对head size 40至 112 调整CUDA下fp16 tile FlashAttention的kernel配置,同时附带各平台预编译包,其中macOS KleidiAI支持与openEuler构建处于禁用状态。
AI解读:llama.cpp发布b11215,真正改代码的只有一条:把CUDA上fp16 tile FlashAttention的配置按head size 40到 112 重新调了一遍。这个区间基本覆盖了主流开源模型的注意力头维度,改动本身是性能向的kernel参数调优,不是新功能。
对用NVIDIA显卡跑本地推理的人来说,这次更新的价值取决于你模型的head size是否落在 40-112 之间;不在这个范围内的模型不会因为这次commit获得任何变化。发布说明没有给出任何加速数字,所以实际提升多少目前无法判断,只能等使用者自己测。
b11215照例提供覆盖macOS、iOS、Linux、Windows、Android的预编译包,Linux侧包含CUDA 12.8和CUDA 13.4两套构建,Windows侧是CUDA 12.4和 13.4。注意macOS的KleidiAI加速版和openEuler构建都标着DISABLED,需要这些平台的人得继续等或者自行编译。
llama.cpp发布构建版本b11215。发布说明中列出的唯一代码变更来自PR #26289:“CUDA: tune fp16 tile FlashAttention configs for head sizes 40-112”,即为head size在 40 到 112 之间的模型调整CUDA后端fp16 tile FlashAttention的配置参数。
该版本同步提供各平台预编译二进制包:macOS Apple Silicon (arm64)、macOS Intel (x64)、iOS XCFramework、Ubuntu x64/arm64/s390x (CPU)、Ubuntu x64/arm64 (Vulkan)、Ubuntu x64 (CUDA 12.8)、Ubuntu x64 (CUDA 13.4)、Ubuntu arm64 (CUDA 13.4)、Ubuntu x64 (ROCm 10.0)、Ubuntu x64 (OpenVINO 2026.4)、Ubuntu x64 (SYCL FP32与FP16)、Linux arm64 Snapdragon(CPU、Adreno GPU、Hexagon NPU)、Android arm64(CPU及Snapdragon版本)、Windows x64/arm64 (CPU)、Windows arm64 (OpenCL Adreno)、Windows x64 (CUDA 12.4与 13.4)、Windows arm64 (CUDA 13.4)、Windows x64 (Vulkan)、Windows x64 (OpenVINO 2026.4)、Windows x64 (SYCL)、Windows x64 (ROCm 10.0),以及UI包。
被禁用的构建目标
- macOS Apple Silicon (arm64, KleidiAI enabled) 标记为DISABLED,指向PR #23780。
- openEuler各构建(x86 310p、x86 910b ACL Graph、aarch64 310p、aarch64 910b ACL Graph)标记为DISABLED,指向PR #23705。