开源llama.cpp Releases·原文 2026年9月14日

llama.cpp b10950发布:CUDA后端在不支持BF16的显卡上回退到F32

该版本在ggml-cuda中新增回退逻辑,当设备缺乏BF16硬件加速时改用F32计算;补丁由Johannes Gäßler参与,并同时应用于NVIDIA设备。

AI解读:llama.cpp发布了b10950构建版本,这一版最实质的改动只有一条:CUDA后端在检测到设备不支持BF16硬件加速时,会回退到F32计算。

受影响的是老一代GPU。按提交说明,NVIDIA需要AMPERE及以上、AMD需要RDNA3或CDNA才算具备BF16硬件加速;低于这条线的卡以前可能在BF16路径上出错或算得不对,现在会自动走F32,代价通常是显存占用和速度,但先把能跑通放在前面。

这类改动对普通用户的存在感很低,你只需要重新下载对应平台的b10950包即可。真正相关的是还在用Pascal、Turing或更老AMD卡跑本地模型的人。

提交信息没有给出性能或精度对比数据,也没有说明具体触发条件是如何检测的,所以回退带来的实际开销目前只能从F32本身的特性推断。

llama.cpp项目发布了b10950构建版本,主要改动位于ggml-cuda后端:在没有BF16硬件加速的设备上回退到F32计算。

回退规则与适用硬件

提交说明写明,这次改动的目的是在没有BF16硬件加速的设备上回退到F32,并给出了硬件范围:NVIDIA需要AMPERE及以上,AMD需要RDNA3或CDNA。

同一提交还注明“将这一逻辑同样应用于NVIDIA”,补丁由Johannes Gäßler参与(Co-authored-by),对应PR编号 #28846。

随版本发布的构建产物

b10950与往常一样附带了各平台预编译包,覆盖macOS、iOS、Linux、Android、Windows等。

其中CUDA相关包包括Windows x64的CUDA 12(12.4)与CUDA 13(13.3),以及Windows arm64的CUDA 13(13.4),并各自附带对应的cudart DLL包。

Linux侧提供Ubuntu x64/arm64的CPU包、Ubuntu s390x、x64/arm64的Vulkan、x64的ROCm 10.0、x64的OpenVINO 2026.3.1,以及x64的SYCL FP32与SYCL FP16。

Windows侧还有x64/arm64的CPU、arm64的OpenCL Adreno、x64的Vulkan、x64的OpenVINO 2026.3.1、x64的SYCL与x64的ROCm 10.0。

  • macOS/iOS:Apple Silicon(arm64)、Intel(x64)以及iOS XCFramework。
  • macOS Apple Silicon的KleidiAI版本标注为DISABLED,并指向PR #23780。
  • Android:arm64的CPU包。
  • openEuler相关构建同样标注为DISABLED,并指向PR #23705,涉及x86的 310p、x86的 910b(ACL Graph)、aarch64的 310p和aarch64的 910b(ACL Graph)。
  • 另提供单独的UI包。

信息来源

llama.cpp Releases原始来源