llama.cpp发布b11456:CUDA缓冲区初始化填充改用每线程流,ROCm测试重新启用 -j
该版本的主要代码变更为ggml-cuda在缓冲区初始化的padding memset中使用每线程CUDA stream(PR #28782),CI方面重新为ROCm启用test-backend-ops的 -j并行参数。
AI解读:llama.cpp发布b11456,标题列出的两处改动是ggml-cuda在buffer-init的padding memset中改用per-thread stream(PR #28782),以及CI重新为ROCm启用test-backend-ops的 -j选项。
发布说明只给出改动项,没有提供性能数据、兼容性说明或适用范围描述,因此无法从该版本判断实际性能变化。
该版本按平台提供预编译包:macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework、Linux、Android、Windows等。
部分构建在本次发布中标注为DISABLED:macOS Apple Silicon的KleidiAI启用版(关联PR #23780)以及openEuler构建(关联PR #23705)。
Linux构建覆盖CPU、Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL FP32/FP16,以及Snapdragon的CPU、Adreno GPU、Hexagon NPU组合。
Windows构建覆盖CPU、OpenCL Adreno、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0;Android覆盖CPU与Snapdragon三后端。
llama.cpp发布b11456版本,发布说明列出的代码改动为:ggml-cuda在缓冲区初始化的padding memset中使用每线程CUDA流(PR #28782),CI重新为ROCm启用test-backend-ops的多线程参数 -j。
本次改动与CI
发布说明的改动条目仅有两项:ggml-cuda的buffer-init padding memset改用per-thread stream(对应PR #28782),以及CI中重新启用ROCm上的test-backend-ops -j。
说明中未给出这两项改动的性能对比、适用GPU型号或对既有行为影响的细节,因此无法从该发布文本推断实际收益或回归风险。
- ggml-cuda:buffer-init padding memset使用per-thread stream(PR #28782)
- CI:ROCm重新启用test-backend-ops -j
各平台构建产物
该版本按平台分发预编译包,涵盖macOS/iOS、Linux、Android、Windows,以及标注为DISABLED的openEuler条目。UI包也单独提供。
macOS Apple Silicon的KleidiAI启用版标注为DISABLED,并关联PR #23780;openEuler构建同样标注为DISABLED,关联PR #23705。
- macOS:Apple Silicon arm64、Intel x64;iOS提供XCFramework
- Linux:CPU(x64/arm64/s390x)、Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL FP32/FP16
- Android:arm64 CPU、arm64 Snapdragon(CPU、Adreno GPU、Hexagon NPU)
- Windows:CPU(x64/arm64)、OpenCL Adreno(arm64)、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0
- 禁用项:macOS KleidiAI(PR #23780)、openEuler(PR #23705)