开源llama.cpp Releases·原文 2026年10月5日

llama.cpp b11403发布:CUDA在小批量下对薄f16/bf16矩阵乘改用MMVF

llama.cpp发布b11403版本,唯一代码改动是CUDA后端在较小批量、较薄f16/bf16 mul_mat形状下改用MMVF,并调整了内核选择逻辑,作者为ynankani,Johannes Gäßler参与协作。

AI解读:这次改动的适用条件是两个限定:CUDA后端、小批量(small batch size)下的薄f16/bf16矩阵乘(mul_mat)。离开这两个条件是否仍走MMVF,来源没有说明。

llama.cpp发布b11403,按发布说明,本次代码变更是“CUDA: use MMVF for thin f16/bf16 mul_mat at small batch size (#29633)”。

改动内容包括两点:在CUDA后端对薄的f16/bf16 mul_mat、在小批量规模下使用MMVF;并调整内核选择逻辑。发布说明的署名信息为ynankani提交、Johannes Gäßler共同参与。

这次改动改了哪里

发布说明把改动范围限定在CUDA后端,数据类型限定为f16和bf16,算子为mul_mat,形状限定为“薄”(thin),批量规模限定为“小”。在这些条件之外的行为,来源没有给出。

同一说明还写明对内核选择逻辑做了调整,但没有展开新的选择规则细节。

随版本提供的构建产物

  • macOS/iOS:macOS Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework;Apple Silicon的KleidiAI版本标注为DISABLED(指向PR #23780)。
  • Linux:Ubuntu x64/arm64/s390x(CPU)、Vulkan(x64/arm64)、CUDA 12(x64)、CUDA 13(x64/arm64)、ROCm 10.0(x64)、OpenVINO(x64)、SYCL FP32/FP16(x64),以及Linux arm64 Snapdragon(CPU、Adreno GPU、Hexagon NPU)。
  • Android:Android arm64(CPU)和Android arm64 Snapdragon(CPU、Adreno GPU、Hexagon NPU)。
  • Windows:x64/arm64(CPU)、Windows arm64(OpenCL Adreno)、CUDA 12.4(x64)、CUDA 13.4(x64/arm64)、Vulkan(x64/arm64)、OpenVINO(x64)、SYCL(x64)、ROCm 10.0(x64)。
  • openEuler:发布说明中标注为DISABLED(指向PR #23705),列出x86 310p、x86 910b(ACL Graph)、aarch64 310p、aarch64 910b(ACL Graph)。
  • 另有UI压缩包。

信息来源

llama.cpp Releases原始来源