开源llama.cpp Releases·原文 2026年9月12日

llama.cpp b10921修复WebGPU块量化张量绑定偏移

llama.cpp发布b10921版本,WebGPU后端将张量绑定偏移回退对齐到类型块大小,使块量化视图在着色器中获得有效元素偏移。

llama.cpp发布b10921版本,唯一列出的改动在WebGPU后端:将张量绑定(tensor bindings)对齐到类型块大小(type block size)。

版本说明里的描述是:把绑定偏移往回走,直到它与张量之间的距离是整数个块,这样块量化视图(block quantized views)才能在着色器中拿到有效的元素偏移。该改动对应PR #28382。

改动细节与归因

b10921的发布说明中,唯一带描述的条目是“webgpu: align tensor bindings to the type block size (#28382)”。原文解释:Walk the binding offset back until the distance to the tensor is a whole number of blocks, so block quantized views get a valid element offset in the shader。

据此,修复动作发生在计算绑定偏移的环节,目标是让块量化视图在着色器里得到合法的元素偏移。发布说明没有给出性能数字或测试结果。

  • 改动标识:PR #28382,标题为webgpu: align tensor bindings to the type block size。
  • 版本号:b10921,发布方为ggml-org/llama.cpp。

随版本提供的构建包

发布说明同时列出了各平台构建产物,说明这次更新覆盖的下载面。macOS/iOS提供macOS Apple Silicon(arm64)与macOS Intel(x64)压缩包以及iOS XCFramework;其中macOS Apple Silicon的KleidiAI版本标注为DISABLED。

Linux提供Ubuntu x64、arm64、s390x的CPU包,以及x64/arm64的Vulkan、x64的ROCm 10.0、x64的OpenVINO 2026.3.1、x64的SYCL FP32与FP16。Android提供arm64 CPU包。

Windows提供x64与arm64 CPU包、arm64 OpenCL Adreno、x64 CUDA 12(含 12.4 DLL)、x64 CUDA 13(含 13.3 DLL)、arm64 CUDA 13(含 13.4 DLL)、x64 Vulkan、x64 OpenVINO 2026.3.1、x64 SYCL、x64 ROCm 10.0。

openEuler条目标注为DISABLED,链接指向PR #23705;UI包单独发布。以上均为发布页列出的下载项,不包含性能或兼容性结论。

  • macOS/iOS:Apple Silicon arm64、Intel x64、iOS XCFramework;KleidiAI版本DISABLED。
  • Linux:Ubuntu x64/arm64/s390x CPU,Vulkan(x64/arm64)、ROCm 10.0、OpenVINO 2026.3.1、SYCL FP32/FP16。
  • Windows:CPU x64/arm64,OpenCL Adreno arm64,CUDA 12/13与对应DLL,Vulkan、OpenVINO、SYCL、ROCm 10.0。
  • Android:arm64 CPU;openEuler:DISABLED;另提供UI包。

信息来源

llama.cpp Releases原始来源