开源llama.cpp Releases·原文 2026年10月4日

llama.cpp发布b11382:WebGPU后端为fill/set_rows增加f16支持

该版本唯一列出的代码改动是WebGPU后端为fill与set_rows操作加入f16支持,对应PR #29897;其余内容为各平台预编译二进制与库文件下载项。

AI解读:需要弄清的具体问题是:这次改动只影响WebGPU后端的fill和set_rows两个操作,不涉及CUDA、Vulkan、Metal等其他后端,也没有给出性能数字。

适用对象是使用llama.cpp WebGPU构建、并且模型或张量路径会走到f16的fill/set_rows的用户;其他构建的用户从这次提交中得不到可直接验证的行为变化。

来源仅有发布页中一行提交标题“webgpu: add f16 support to fill/set_rows (#29897)”与下载清单,没有说明测试范围、数值精度影响或性能收益,因此无法判断实际提速或误差范围。

llama.cpp发布b11382版本,发布说明中列出的代码改动为:WebGPU后端为fill与set_rows增加f16支持,对应PR #29897。

发布页其余内容是各平台预编译产物与库文件的下载清单,未提供性能数据或测试结论。

本次改动涉及的范围

发布说明把这次改动写为“webgpu: add f16 support to fill/set_rows (#29897)”,指向WebGPU后端,对象是fill与set_rows两个操作,数据类型为f16。来源未说明该支持是否默认启用、是否需要额外编译开关,也未说明对已有f16路径之外的其他类型是否产生影响。

  • 主体:llama.cpp项目(ggml-org/ggml-org仓库)
  • 版本:b11382
  • 改动:WebGPU后端为fill/set_rows增加f16支持
  • PR编号:#29897
  • 来源未给出性能或精度测试数据

随版本提供的构建产物

发布页列出了macOS/iOS、Linux、Android、Windows以及UI的下载项,覆盖CPU与多种加速后端。其中macOS的Apple Silicon KleidiAI版本标记为DISABLED,openEuler相关条目也标记为DISABLED。Linux侧包含Ubuntu x64/arm64/s390x的CPU构建,以及Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL FP32/FP16构建;Android提供arm64 CPU与Snapdragon(CPU、Adreno GPU、Hexagon NPU)构建;Windows提供CPU、OpenCL Adreno、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0构建。

  • macOS Apple Silicon(arm64、KleidiAI enabled)标记为DISABLED
  • openEuler各项标记为DISABLED
  • CUDA 12与CUDA 13在Linux/Windows分别对应不同库文件
  • Snapdragon构建附带setup guide链接

信息来源

llama.cpp Releases原始来源