llama.cpp b11362为Metal后端加入Tensor API Flash Attention内核(F16 KV)
llama.cpp发布b11362构建,Metal后端新增面向F16 KV的Tensor API Flash Attention内核,并扩展多种注意力特性与头维度支持。
llama.cpp发布b11362版本,变更内容为Metal后端新增面向F16 KV的Tensor API Flash Attention内核(PR #29570)。
该PR的追加提交中,新增了DK=DV=512 以及DK=576、DV=512 的Tensor FA内核,并在Tensor FA内核中支持attention sinks、ALiBi和logit softcap。
随后又加入DK=192、DV=128 的Tensor FA内核。
随该版本一同提供macOS/iOS、Linux、Android、Windows以及UI的预编译构建产物。
Metal后端新增Tensor API Flash Attention内核
变更摘要标题为“metal : add tensor API flash attention kernel for F16 KV (#29570)”。
摘要列出的迭代内容包括:为F16 KV添加Tensor API Flash Attention内核;为DK=DV=512 与DK=576、DV=512 添加Tensor FA内核;在Tensor FA内核中支持attention sinks、ALiBi与logit softcap;为DK=192、DV=128 添加Tensor FA内核。
随版本发布的构建产物
发布页列出以下平台的预编译产物:macOS/iOS提供macOS Apple Silicon (arm64)、macOS Intel (x64) 和iOS XCFramework;其中macOS Apple Silicon (arm64, KleidiAI enabled) 标记为DISABLED。
Linux提供Ubuntu x64/arm64(CPU)、Ubuntu s390x(CPU)、Ubuntu x64/arm64(Vulkan)、Ubuntu x64(CUDA 12与CUDA 13)、Ubuntu arm64(CUDA 13)、Ubuntu x64(ROCm 10.0)、Ubuntu x64(OpenVINO 2026.4)、Ubuntu x64(SYCL FP32与SYCL FP16),以及Linux arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU),并附有对应CUDA库文件。
Android提供Android arm64(CPU)与Android arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU),并附有Snapdragon设置指南链接。
Windows提供x64/arm64(CPU)、Windows arm64(OpenCL Adreno)、Windows x64(CUDA 12与CUDA 13)、Windows arm64(CUDA 13)、Windows x64(Vulkan)、Windows x64(OpenVINO 2026.4)、Windows x64(SYCL)以及Windows x64(ROCm 10.0),并附有对应CUDA DLL。
openEuler相关条目标记为DISABLED,列出openEuler x86(310p)、openEuler x86(910b, ACL Graph)、openEuler aarch64(310p)、openEuler aarch64(910b, ACL Graph)。
此外还提供UI打包产物。