llama.cpp b10921修复WebGPU块量化张量绑定偏移
llama.cpp发布b10921版本,WebGPU后端将张量绑定偏移回退对齐到类型块大小,使块量化视图在着色器中获得有效元素偏移。
llama.cpp发布b10921版本,唯一列出的改动在WebGPU后端:将张量绑定(tensor bindings)对齐到类型块大小(type block size)。
版本说明里的描述是:把绑定偏移往回走,直到它与张量之间的距离是整数个块,这样块量化视图(block quantized views)才能在着色器中拿到有效的元素偏移。该改动对应PR #28382。
改动细节与归因
b10921的发布说明中,唯一带描述的条目是“webgpu: align tensor bindings to the type block size (#28382)”。原文解释:Walk the binding offset back until the distance to the tensor is a whole number of blocks, so block quantized views get a valid element offset in the shader。
据此,修复动作发生在计算绑定偏移的环节,目标是让块量化视图在着色器里得到合法的元素偏移。发布说明没有给出性能数字或测试结果。
- 改动标识:PR #28382,标题为webgpu: align tensor bindings to the type block size。
- 版本号:b10921,发布方为ggml-org/llama.cpp。
随版本提供的构建包
发布说明同时列出了各平台构建产物,说明这次更新覆盖的下载面。macOS/iOS提供macOS Apple Silicon(arm64)与macOS Intel(x64)压缩包以及iOS XCFramework;其中macOS Apple Silicon的KleidiAI版本标注为DISABLED。
Linux提供Ubuntu x64、arm64、s390x的CPU包,以及x64/arm64的Vulkan、x64的ROCm 10.0、x64的OpenVINO 2026.3.1、x64的SYCL FP32与FP16。Android提供arm64 CPU包。
Windows提供x64与arm64 CPU包、arm64 OpenCL Adreno、x64 CUDA 12(含 12.4 DLL)、x64 CUDA 13(含 13.3 DLL)、arm64 CUDA 13(含 13.4 DLL)、x64 Vulkan、x64 OpenVINO 2026.3.1、x64 SYCL、x64 ROCm 10.0。
openEuler条目标注为DISABLED,链接指向PR #23705;UI包单独发布。以上均为发布页列出的下载项,不包含性能或兼容性结论。
- macOS/iOS:Apple Silicon arm64、Intel x64、iOS XCFramework;KleidiAI版本DISABLED。
- Linux:Ubuntu x64/arm64/s390x CPU,Vulkan(x64/arm64)、ROCm 10.0、OpenVINO 2026.3.1、SYCL FP32/FP16。
- Windows:CPU x64/arm64,OpenCL Adreno arm64,CUDA 12/13与对应DLL,Vulkan、OpenVINO、SYCL、ROCm 10.0。
- Android:arm64 CPU;openEuler:DISABLED;另提供UI包。