开源llama.cpp Releases·原文 2026年9月11日

llama.cpp b10905发布:为RDNA4开启head size 256的MMA Flash Attention

该版本集中在CUDA/HIP的Flash Attention调优,HIP后端在RDNA4(gfx1201)上为head size 256启用mma FA并调整配置;AMD WMMA路径改为优先整块tile的FA网格而非stream-k。

llama.cpp发布b10905版本,主改动是CUDA/HIP的Flash Attention调优,PR编号 #28102,标题标注目标为gfx1201(AMD RDNA4)。

提交说明列出三项改动:HIP在RDNA4上为head size 256启用mma Flash Attention并调整配置;在AMD WMMA路径上优先使用整块tile的FA网格,而非stream-k;修订stream_k逻辑;修订内核选择逻辑。

提交由Johannes Gäßler合作完成,提交信息中注明Assisted-by: Claude、Assisted-by: Codex。

发布页照常附带各平台预编译包下载,涵盖macOS、Linux、Android、Windows与UI。macOS Apple Silicon的KleidiAI启用版本与openEuler构建标记为DISABLED。

b10905的两处HIP内核改动

按发布说明,HIP后端在RDNA4(gfx1201)上为head size 256启用了mma Flash Attention,并对配置做了调优。此前该组合是否走mma路径,发布内容未作对比说明。

另一项改动针对AMD WMMA路径:FA网格选择优先整块tile,而不是stream-k。提交同时修订了stream_k逻辑与内核选择逻辑,说明在什么条件下用哪种网格、用哪个内核属于本次调整范围。

发布说明没有给出速度、显存或吞吐的量化数字,因此这些改动在具体显卡和模型上带来多大差异,需要用户自行在对应硬件与模型配置下测量。

  • 改动范围:CUDA/HIP的Flash Attention路径
  • 目标硬件标注:gfx1201,即AMD RDNA4
  • HIP改动 1:head size 256启用mma FA,并调configs
  • HIP改动 2:AMD WMMA上优先整块tile FA网格,替代stream-k
  • 附带修订:stream_k逻辑、内核选择逻辑
  • 合作者:Johannes Gäßler;提交信息标注Claude、Codex协助

发布包与仍被禁用的构建

该版本提供的预编译包按平台划分。macOS/iOS包括Apple Silicon(arm64)、Intel(x64)和iOS XCFramework;其中macOS Apple Silicon开启KleidiAI的版本仍标记为DISABLED,链接指向PR 23780。

Linux侧覆盖Ubuntu x64、arm64、s390x的CPU包,以及Vulkan(x64、arm64)、ROCm 10.0 x64、OpenVINO 2026.3.1 x64、SYCL FP32与FP16 x64。Android提供arm64 CPU包。

Windows侧包括x64与arm64的CPU包、arm64的OpenCL Adreno、x64的CUDA 12.4与 13.3、arm64的CUDA 13.4,以及对应的CUDA运行时DLL包;另有Vulkan、OpenVINO 2026.3.1、SYCL和ROCm 10.0的x64包。openEuler的x86 310p、x86 910b(ACL Graph)、aarch64 310p、aarch64 910b(ACL Graph)全部标记为DISABLED,链接指向PR 23705。UI包单独提供。

信息来源

llama.cpp Releases原始来源