llama.cpp发布b11417:为NVFP4类型优化CUDA mmq累加
该版本由llama.cpp仓库自动发布,主要变更是在ggml_cuda的mmq_vec_dot_fp4_fp4_mma中优化累加(accumulation)以提升性能,并附带一轮空白与缩进修正。
AI解读:具体改动为在ggml_cuda的mmq_vec_dot_fp4_fp4_mma中优化累加,发布说明给出的目的是better performance。
发布内容还包含两项清理性修正:去除空白字符,以及修正mma_block_scaled_fp4循环中的缩进。
发布页列出了macOS/iOS、Linux、Android、Windows等平台的构建产物下载链接;其中macOS Apple Silicon(arm64,KleidiAI enabled)与openEuler项标注为DISABLED。
发布说明未给出性能提升幅度、基准测试数据或适用硬件范围的量化结论。
llama.cpp发布b11417版本,发布信息由仓库的github-actions[bot] 发出。此次变更标题为“CUDA: Optimize accumulation in mmq for NVFP4 type”(PR #29857)。
发布说明称,改动在ggml_cuda的mmq_vec_dot_fp4_fp4_mma中优化累加以提升性能,同时去除空白字符并修正mma_block_scaled_fp4循环中的缩进。
本次变更内容与范围
b11417的唯一主题变更是CUDA后端针对NVFP4类型的mmq累加优化。发布说明把它记为PR #29857,涉及函数mmq_vec_dot_fp4_fp4_mma。
同一提交还包含两项格式层面的修正:删除空白字符、修正mma_block_scaled_fp4循环中的缩进。发布说明没有说明这些改动是否改变数值结果。
- 变更标题:CUDA: Optimize accumulation in mmq for NVFP4 type
- PR编号:#29857
- 涉及函数:ggml_cuda的mmq_vec_dot_fp4_fp4_mma
- 附带修正:去除空白、修正mma_block_scaled_fp4循环缩进
发布产物
发布页按平台列出下载项,覆盖macOS/iOS、Linux、Android、Windows以及UI等构建。其中macOS Apple Silicon(arm64,KleidiAI enabled)标注为DISABLED,并关联PR #23780;openEuler整组同样标注为DISABLED,并关联PR #23705。
CUDA相关产物区分CUDA 12与CUDA 13:Ubuntu x64提供CUDA 12.8与CUDA 13.4版本,Windows x64提供CUDA 12.4与CUDA 13.4版本,并各自附带对应的cudart库压缩包。
- macOS Apple Silicon(arm64,KleidiAI enabled):DISABLED(关联PR #23780)
- openEuler:DISABLED(关联PR #23705)
- Ubuntu x64:CUDA 12.8与CUDA 13.4版本,附对应cudart库
- Windows x64:CUDA 12.4与CUDA 13.4版本,附对应DLL
- 其他平台:Linux(CPU、Vulkan、ROCm 10.0、OpenVINO、SYCL FP32/FP16)、Android arm64、Windows CPU/Vulkan/OpenCL Adreno/OpenVINO/SYCL/ROCm 10.0、UI