开源llama.cpp Releases·原文 2026年10月5日

llama.cpp发布b11417:为NVFP4类型优化CUDA mmq累加

该版本由llama.cpp仓库自动发布,主要变更是在ggml_cuda的mmq_vec_dot_fp4_fp4_mma中优化累加(accumulation)以提升性能,并附带一轮空白与缩进修正。

AI解读:具体改动为在ggml_cuda的mmq_vec_dot_fp4_fp4_mma中优化累加,发布说明给出的目的是better performance。

发布内容还包含两项清理性修正:去除空白字符,以及修正mma_block_scaled_fp4循环中的缩进。

发布页列出了macOS/iOS、Linux、Android、Windows等平台的构建产物下载链接;其中macOS Apple Silicon(arm64,KleidiAI enabled)与openEuler项标注为DISABLED。

发布说明未给出性能提升幅度、基准测试数据或适用硬件范围的量化结论。

llama.cpp发布b11417版本,发布信息由仓库的github-actions[bot] 发出。此次变更标题为“CUDA: Optimize accumulation in mmq for NVFP4 type”(PR #29857)。

发布说明称,改动在ggml_cuda的mmq_vec_dot_fp4_fp4_mma中优化累加以提升性能,同时去除空白字符并修正mma_block_scaled_fp4循环中的缩进。

本次变更内容与范围

b11417的唯一主题变更是CUDA后端针对NVFP4类型的mmq累加优化。发布说明把它记为PR #29857,涉及函数mmq_vec_dot_fp4_fp4_mma。

同一提交还包含两项格式层面的修正:删除空白字符、修正mma_block_scaled_fp4循环中的缩进。发布说明没有说明这些改动是否改变数值结果。

  • 变更标题:CUDA: Optimize accumulation in mmq for NVFP4 type
  • PR编号:#29857
  • 涉及函数:ggml_cuda的mmq_vec_dot_fp4_fp4_mma
  • 附带修正:去除空白、修正mma_block_scaled_fp4循环缩进

发布产物

发布页按平台列出下载项,覆盖macOS/iOS、Linux、Android、Windows以及UI等构建。其中macOS Apple Silicon(arm64,KleidiAI enabled)标注为DISABLED,并关联PR #23780;openEuler整组同样标注为DISABLED,并关联PR #23705。

CUDA相关产物区分CUDA 12与CUDA 13:Ubuntu x64提供CUDA 12.8与CUDA 13.4版本,Windows x64提供CUDA 12.4与CUDA 13.4版本,并各自附带对应的cudart库压缩包。

  • macOS Apple Silicon(arm64,KleidiAI enabled):DISABLED(关联PR #23780)
  • openEuler:DISABLED(关联PR #23705)
  • Ubuntu x64:CUDA 12.8与CUDA 13.4版本,附对应cudart库
  • Windows x64:CUDA 12.4与CUDA 13.4版本,附对应DLL
  • 其他平台:Linux(CPU、Vulkan、ROCm 10.0、OpenVINO、SYCL FP32/FP16)、Android arm64、Windows CPU/Vulkan/OpenCL Adreno/OpenVINO/SYCL/ROCm 10.0、UI

信息来源

llama.cpp Releases原始来源