开源llama.cpp Releases·原文 2026年9月11日

llama.cpp发布b10901:Vulkan后端在上下文空闲时改用CPU写入

该版本唯一的代码改动是ggml_backend_vk_cpy_tensor_async在上下文空闲时使用CPU写入,同时照例放出各平台预编译包。

AI解读:这条改动针对的是张量异步拷贝路径。当Vulkan上下文没有其他任务在跑时,走CPU写入可以避开GPU侧的调度开销;至于实际快多少,发布说明里没有给数据。

普通用户直接下载预编译包即可,Windows有CUDA 12/13、Vulkan、SYCL、ROCm、OpenVINO等版本,Linux覆盖x64、arm64、s390x,另外还有macOS、iOS、Android包。

macOS的KleidiAI加速版本和openEuler构建目前是DISABLED状态,说明对应PR被关闭,这些平台暂时拿不到这两类产物。

llama.cpp发布b10901构建,唯一代码改动来自PR #28618:Vulkan后端函数ggml_backend_vk_cpy_tensor_async在上下文空闲时改用CPU写入,而不走GPU路径。

发布页同时列出各平台预编译产物,包括Windows的CUDA 12.4/13.3/13.4、Vulkan、SYCL、ROCm 10.0、OpenVINO 2026.3.1版本,Linux的x64/arm64/s390x CPU、Vulkan、ROCm 10.0、OpenVINO 2026.3.1、SYCL FP32/FP16版本,以及macOS Apple Silicon(arm64)和Intel(x64)、iOS XCFramework、Android arm64与UI包。

改动只涉及Vulkan异步张量拷贝的空闲路径

b10901的改动标题为“vulkan: use CPU writes in ggml_backend_vk_cpy_tensor_async if the context is idle (#28618)”。函数名表明它处理的是Vulkan后端张量异步拷贝;条件“if the context is idle”说明只有当Vulkan上下文空闲时才会走CPU写入。

发布说明没有给出这项改动的性能数据、测试结果或所影响的模型规模,因此无法判断它在实际推理中能带来多少收益。

多个平台构建可用,两类产物被禁用

发布页按平台列出可下载的压缩包。macOS提供Apple Silicon(arm64)与Intel(x64)版本,以及iOS XCFramework;Android提供arm64 CPU版本;UI单独打包。

Linux侧包含Ubuntu x64/arm64/s390x的CPU构建,以及x64/arm64的Vulkan构建、x64的ROCm 10.0、OpenVINO 2026.3.1、SYCL FP32与SYCL FP16。

Windows侧包含x64/arm64 CPU、arm64 OpenCL Adreno,以及x64的CUDA 12.4、CUDA 13.3、Vulkan、OpenVINO 2026.3.1、SYCL、ROCm 10.0构建,并附CUDA 12.4、13.3、13.4 的DLL包,另有arm64的CUDA 13.4版本。

  • macOS Apple Silicon(arm64,启用KleidiAI)标记为DISABLED,对应PR #23780。
  • openEuler的x86 310p、x86 910b(ACL Graph)、aarch64 310p、aarch64 910b(ACL Graph)均标记为DISABLED,对应PR #23705。

信息来源

llama.cpp Releases原始来源