开源llama.cpp Releases·原文 2026年10月7日

llama.cpp发布b11456:CUDA缓冲区初始化填充改用每线程流,ROCm测试重新启用 -j

该版本的主要代码变更为ggml-cuda在缓冲区初始化的padding memset中使用每线程CUDA stream(PR #28782),CI方面重新为ROCm启用test-backend-ops的 -j并行参数。

AI解读:llama.cpp发布b11456,标题列出的两处改动是ggml-cuda在buffer-init的padding memset中改用per-thread stream(PR #28782),以及CI重新为ROCm启用test-backend-ops的 -j选项。

发布说明只给出改动项,没有提供性能数据、兼容性说明或适用范围描述,因此无法从该版本判断实际性能变化。

该版本按平台提供预编译包:macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework、Linux、Android、Windows等。

部分构建在本次发布中标注为DISABLED:macOS Apple Silicon的KleidiAI启用版(关联PR #23780)以及openEuler构建(关联PR #23705)。

Linux构建覆盖CPU、Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL FP32/FP16,以及Snapdragon的CPU、Adreno GPU、Hexagon NPU组合。

Windows构建覆盖CPU、OpenCL Adreno、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0;Android覆盖CPU与Snapdragon三后端。

llama.cpp发布b11456版本,发布说明列出的代码改动为:ggml-cuda在缓冲区初始化的padding memset中使用每线程CUDA流(PR #28782),CI重新为ROCm启用test-backend-ops的多线程参数 -j。

本次改动与CI

发布说明的改动条目仅有两项:ggml-cuda的buffer-init padding memset改用per-thread stream(对应PR #28782),以及CI中重新启用ROCm上的test-backend-ops -j。

说明中未给出这两项改动的性能对比、适用GPU型号或对既有行为影响的细节,因此无法从该发布文本推断实际收益或回归风险。

  • ggml-cuda:buffer-init padding memset使用per-thread stream(PR #28782)
  • CI:ROCm重新启用test-backend-ops -j

各平台构建产物

该版本按平台分发预编译包,涵盖macOS/iOS、Linux、Android、Windows,以及标注为DISABLED的openEuler条目。UI包也单独提供。

macOS Apple Silicon的KleidiAI启用版标注为DISABLED,并关联PR #23780;openEuler构建同样标注为DISABLED,关联PR #23705。

  • macOS:Apple Silicon arm64、Intel x64;iOS提供XCFramework
  • Linux:CPU(x64/arm64/s390x)、Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL FP32/FP16
  • Android:arm64 CPU、arm64 Snapdragon(CPU、Adreno GPU、Hexagon NPU)
  • Windows:CPU(x64/arm64)、OpenCL Adreno(arm64)、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0
  • 禁用项:macOS KleidiAI(PR #23780)、openEuler(PR #23705)

信息来源

llama.cpp Releases原始来源