开源llama.cpp Releases·原文 2026年10月5日

llama.cpp发布b11425:修复CUDA alloc_deps检查的批处理依赖问题

该版本将CUDA后端中alloc_deps检查改为与batch无关,修复issue #29980;发布页同时列出macOS、Linux、Windows、Android等多平台预编译包。

AI解读:发布页称该改动修复 #29980,即alloc_deps检查此前与batch绑定所导致的问题;具体故障表现和影响范围未在来源中说明。

该版本提供macOS/iOS、Linux、Windows、Android以及UI的预编译产物,涵盖CPU、CUDA 12、CUDA 13、Vulkan、ROCm 10.0、OpenVINO、SYCL等后端。

发布页注明macOS Apple Silicon的KleidiAI版本和openEuler产物当前处于DISABLED状态。

来源未给出该修复的性能数据或验证结果,因此无法据此推断速度变化或稳定性提升幅度。

llama.cpp发布构建版本b11425。发布说明中列出的代码改动为「CUDA: make the alloc_deps check batch independent (#29986)」,并写明该改动修复 #29980。

发布页未说明 #29980 的具体故障现象,也未给出修复前后的对比数据。

b11425的CUDA改动

发布说明将本次改动标注为CUDA相关,把alloc_deps检查改为batch无关。这是该版本说明中唯一列出的代码变更,对应的拉取请求编号为 #29986。

发布页称该改动修复issue #29980。来源中没有给出该issue的复现条件、受影响显卡或驱动版本等信息,因此改动覆盖范围只能按发布说明本身的描述理解。

  • 改动标题:CUDA: make the alloc_deps check batch independent
  • PR编号:#29986
  • 修复issue:#29980
  • 来源未提供性能或正确性验证数据

提供的预编译产物

b11425的发布页列出了面向多个平台的预编译包,覆盖桌面、移动与部分国产化平台。桌面侧包含macOS Apple Silicon(arm64)与Intel(x64)、iOS XCFramework,以及Ubuntu的x64、arm64、s390x CPU包。

GPU与加速后端方面,Linux与Windows均提供CUDA 12和CUDA 13版本并附带对应cudart库,此外还有Vulkan、ROCm 10.0、OpenVINO、SYCL(FP32/FP16)等构建。Windows另有OpenCL Adreno arm64包和arm64 CPU包。

移动端提供Android arm64的CPU包,以及面向Snapdragon的CPU、Adreno GPU、Hexagon NPU包,并附有安装指南链接。UI也有单独的压缩包。

  • macOS:Apple Silicon arm64、Intel x64、iOS XCFramework
  • Linux:Ubuntu x64/arm64/s390x CPU,另含Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL
  • Windows:x64与arm64 CPU,CUDA 12.4/13.4(含DLL)、Vulkan、OpenVINO、SYCL、ROCm 10.0、OpenCL Adreno arm64
  • Android:arm64 CPU,以及Snapdragon的CPU/Adreno GPU/Hexagon NPU包
  • 其他:UI压缩包

被禁用的产物

发布页把两项标注为DISABLED:macOS Apple Silicon的KleidiAI启用版本,以及openEuler相关产物。openEuler部分原本列出x86的 310p与 910b(ACL Graph)、aarch64的 310p与 910b(ACL Graph),当前都不可用。

  • macOS Apple Silicon(arm64,KleidiAI enabled):DISABLED,附PR #23780
  • openEuler x86 310p / 910b(ACL Graph):DISABLED,附PR #23705
  • openEuler aarch64 310p / 910b(ACL Graph):DISABLED

信息来源

llama.cpp Releases原始来源