开源llama.cpp Releases·原文 2026年10月2日

llama.cpp b11323发布:修复HIP后端将CDNA误判为DGX Spark的问题

该版本针对fattn_mma dqk 576、gqa_ratio 20场景,避免在HIP路径上把CDNA架构当作DGX Spark处理,并同步更新各平台预编译包。

llama.cpp发布b11323版本,该版本列出的代码改动只有一条:在HIP后端中,针对fattn_mma、dqk 576、gqa_ratio 20的情况,避免将CDNA架构当作dgx spark处理(对应PR #29572)。

发布说明以该修正作为版本标题,说明这是一个针对特定注意力内核条件的后端修复。

HIP后端在特定条件下不再把CDNA当作DGX Spark

根据发布说明,改动是“HIP: avoid treating CDNA as dgx spark for gqa_ratio 20 in fattn_mma dqk 576”,关联PR编号为 #29572。

这里涉及的条件包括HIP后端、fattn_mma、dqk 576和gqa_ratio 20;发布说明没有给出性能数字、受影响的具体显卡型号或复现步骤。

同步发布的平台构建包

该版本同时发布了多个平台的预编译包。发布说明中标注为DISABLED的条目包括macOS Apple Silicon的KleidiAI版本(关联PR #23780)以及openEuler构建。

  • macOS/iOS:Apple Silicon arm64、Intel x64、iOS XCFramework。
  • Linux:Ubuntu x64/arm64/s390x的CPU包,x64/arm64的Vulkan包,x64/arm64的CUDA 13.4包,x64的CUDA 12.8包,以及ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16的x64包。
  • Linux arm64还提供Snapdragon版本,覆盖CPU、Adreno GPU、Hexagon NPU,并附有setup guide。
  • Android:arm64 CPU包,以及Snapdragon版本(CPU、Adreno GPU、Hexagon NPU),同样附有setup guide。
  • Windows:x64/arm64 CPU包,arm64 OpenCL Adreno包,x64/arm64 CUDA 13.4包,x64 CUDA 12.4包,以及Vulkan、OpenVINO、SYCL、ROCm 10.0的x64包。
  • 另有独立的UI压缩包。

信息来源

llama.cpp Releases原始来源