开源llama.cpp Releases·原文 2026年9月18日

llama.cpp发布b11037:修复WebGPU后端GET_ROWS的supports_op判断

llama.cpp新版本b11037修复了ggml-webgpu后端对GET_ROWS算子支持条件的判断错误,并同步更新各平台预编译产物。

AI解读:这次更新很小,但改在一个容易踩坑的地方:llama.cpp的WebGPU后端此前判断某个算子能不能跑(supports_op)时,对GET_ROWS的条件写错了,b11037把它修正了。

直接受影响的,是靠浏览器或WebGPU跑推理的人。修复同时处理了GET_ROWS的vec4路径,并在vec4_aligned检查里加入源张量strides的判断,还补了一个测试用例。

普通用户不需要做什么。它不会让模型突然变快,也不是新功能,只是让WebGPU后端在满足特定内存布局时才走这条向量化路径,避免判断失误导致的结果错误;具体影响范围取决于你的模型和输入布局,发布说明没有给出性能数据。

llama.cpp发布b11037版本,主要改动是修复ggml-webgpu后端的supports_op条件判断,涉及GET_ROWS算子(对应PR #28978)。

根据发布说明,该修复包含两部分:修正GET_ROWS的vec4处理,以及在get_rows的vec4_aligned检查中加入源张量strides判定,并新增了一个测试用例。

该版本照例提供各平台预编译产物,覆盖macOS/iOS、Linux、Android、Windows等,包含CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL、OpenCL Adreno等后端选项。

发布页显示,macOS Apple Silicon(arm64,KleidiAI enabled)与openEuler相关构建被标记为DISABLED。

信息来源

llama.cpp Releases原始来源