llama.cpp构建b10993发布:CI任务加入自托管WebGPU与Vulkan
该版本的主要变更是把自托管WebGPU、Vulkan加进hf-jobs的CI流程,构建产物覆盖macOS、Linux、Windows、Android及多种GPU后端。
AI解读:这次llama.cpp的b10993构建,动静最大的不是推理性能,而是自动化测试。提交记录显示CI任务里加入了自托管的WebGPU和Vulkan,用于hf-jobs流程,期间还试过t4-medium、调过CPU后端线程数,最后回退到t4-small并恢复了CM任务。
对普通用户来说,直接能拿到的还是各平台预编译包:macOS Apple Silicon与Intel、iOS XCFramework,Ubuntu的CPU/Vulkan/CUDA 12/CUDA 13/ROCm/OpenVINO/SYCL等版本,以及Windows、Android的对应压缩包。这些包按后端分开,选哪个取决于你手头的显卡和驱动。
需要留意的限制:macOS Apple Silicon的KleidiAI版本标记为DISABLED,openEuler系列构建也处于DISABLED状态,并关联到对应的PR。也就是说,这两类平台在当前版本里默认不提供预编译产物,要用得自己编译或等后续恢复。
llama.cpp发布构建b10993。这一版在CI侧的变更是把自托管WebGPU加入hf-jobs,并同时加入自托管Vulkan;提交记录显示过程中尝试过t4-medium,调整了CPU后端线程数,又试了一次t4-small,最后恢复CM任务。该提交由Georgi Gerganov共同署名。
发布页列出的预编译产物覆盖多个平台。macOS/iOS方面提供macOS Apple Silicon(arm64)、macOS Intel(x64)和iOS XCFramework;其中macOS Apple Silicon的KleidiAI enabled版本标记为DISABLED,关联PR #23780。
Linux产物包括Ubuntu x64、arm64、s390x的CPU版本,Ubuntu x64、arm64的Vulkan版本,Ubuntu x64的CUDA 12(含CUDA 12.8库)和CUDA 13(含CUDA 13.3库),Ubuntu arm64的CUDA 13,Ubuntu x64的ROCm 10.0、OpenVINO 2026.3.1、SYCL FP32与SYCL FP16。Android提供arm64 CPU包。
Windows产物包括x64与arm64的CPU包、arm64的OpenCL Adreno包、x64的CUDA 12(含 12.4 DLL)、x64与arm64的CUDA 13(含 13.4 DLL)、x64的Vulkan、x64的OpenVINO 2026.3.1、x64的SYCL,以及x64的ROCm 10.0。openEuler条目整体标记为DISABLED,关联PR #23705,原计划覆盖x86 310p、x86 910b(ACL Graph)、aarch64 310p、aarch64 910b(ACL Graph)。
发布页还单独提供UI包。以上信息来自发布页的构建说明与产物列表,本次来源没有给出模型推理性能或基准测试数据。