开源llama.cpp Releases·原文 2026年9月27日

llama.cpp b11214为CDNA架构开启dkq>256 的fattn-mma内核

该版本针对大batch size场景,在AMD CDNA架构上启用了dkq大于 256 时的fattn-mma内核,并在CI中忽略超大MFMA内核的寄存器溢出检查。

llama.cpp发布b11214版本。据该版本发布说明,本次改动为HIP后端在CDNA架构上、dkq大于 256 且batch size较大的场景启用了fattn-mma内核(PR #28907)。

同一提交还在CI中做了对应调整:hip-quality-check对very large mfma mma kernels忽略spills(寄存器溢出)。

发布页同时列出了各平台预编译包的下载链接,涵盖macOS、iOS、Linux、Windows、Android以及UI等构建产物。

HIP后端在CDNA上为dkq>256 开启fattn-mma

根据b11214的发布说明,改动标题为“HIP: Enable fattn-mma kernel on cdna for dkq > 256 for large batch sizes”,对应PR #28907。

生效范围被限定在三个条件同时满足时:HIP后端、CDNA架构、dkq大于 256;此外改动描述中写明针对large batch sizes,也就是大batch场景。

  • 改动仅提及HIP后端和CDNA架构,未说明是否涉及其他AMD架构或其他后端。
  • dkq阈值是 256,仅对大于 256 的情况启用。
  • 发布说明未给出该改动带来的性能数字或具体基准测试结果。

CI对超大MFMA内核放行寄存器溢出

同一发布说明列出第二条改动:“CI: hip-quality-check: ignore spills for very large mfma mma kernels”。

也就是说,在hip-quality-check这一质量检查环节中,very large的mfma mma内核发生的spills会被忽略,不再作为检查失败项。

  • 该调整针对very large mfma mma kernels,不是全部HIP内核。
  • 发布说明没有解释spills的具体数量或对运行结果的影响。

同步发布的各平台构建产物

b11214发布页按平台列出了预编译产物,覆盖macOS、iOS、Linux、Windows、Android和UI。

发布页中macOS Apple Silicon的KleidiAI版本标注为DISABLED,指向PR #23780;openEuler相关产物同样标注DISABLED,指向PR #23705。

  • macOS/iOS:Apple Silicon arm64、Intel x64、iOS XCFramework;Apple Silicon的KleidiAI版本处于DISABLED。
  • Linux:Ubuntu x64与arm64的CPU版、s390x CPU版、Vulkan版、CUDA 12.8与CUDA 13.4版(含arm64)、ROCm 10.0版、OpenVINO 2026.4版、SYCL FP32与FP16版,以及Snapdragon的CPU、Adreno GPU、Hexagon NPU版。
  • Android:arm64 CPU版,以及arm64 Snapdragon的CPU、Adreno GPU、Hexagon NPU版。
  • Windows:x64与arm64 CPU版、arm64 OpenCL Adreno版、CUDA 12.4与CUDA 13.4版(含arm64)、Vulkan版、OpenVINO 2026.4版、SYCL版、ROCm 10.0版。
  • openEuler的x86 310p、x86 910b(ACL Graph)、aarch64 310p、aarch64 910b(ACL Graph)均标注DISABLED。
  • 另提供UI构建产物。

信息来源

llama.cpp Releases原始来源