开源llama.cpp Releases·原文 2026年10月2日

llama.cpp b11333为WebGPU的MUL_MAT/MUL_MAT_ID/GET_ROWS加入bfloat16支持

llama.cpp发布b11333版本,唯一列出的变更是WebGPU后端为MUL_MAT、MUL_MAT_ID和GET_ROWS三个算子增加bfloat16支持,对应PR #29358;同版本继续提供各平台预编译包。

llama.cpp发布b11333版本,发布说明中列出的唯一变更是:WebGPU后端为MUL_MAT、MUL_MAT_ID和GET_ROWS三个算子增加bfloat16支持,对应PR #29358。

发布页同时提供该版本的各平台预编译产物,包括macOS(Apple Silicon与Intel)、iOS XCFramework、Linux(Ubuntu x64/arm64/s390x,以及Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO、SYCL等构建)、Android(CPU及骁龙CPU/Adreno GPU/Hexagon NPU)、Windows(CPU、OpenCL Adreno、CUDA 12.4/13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0)以及UI包。

b11333的唯一代码变更:WebGPU三个算子支持bfloat16

发布说明列出的变更内容为:WebGPU增加对MUL_MAT、MUL_MAT_ID、GET_ROWS的bfloat16支持,关联PR #29358。

MUL_MAT是矩阵乘法,MUL_MAT_ID是带ID的矩阵乘法(常见于MoE类模型的专家路由),GET_ROWS用于按行取数据(例如嵌入查表),三者都是推理过程中的核心算子。

发布说明未提及该变更带来的性能或内存数据,也未说明对具体模型的支持范围。

预编译产物与部分禁用项

该版本按既有流程提供多平台预编译包:macOS Apple Silicon(arm64)与Intel(x64)、iOS XCFramework;Ubuntu x64/arm64/s390x的CPU构建,以及Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL(FP32/FP16)构建;Android arm64的CPU与骁龙(CPU、Adreno GPU、Hexagon NPU)构建;Windows的CPU(x64/arm64)、OpenCL Adreno、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0构建。

macOS Apple Silicon的KleidiAI启用版和openEuler相关构建在发布页标注为DISABLED。

信息来源

llama.cpp Releases原始来源