开源llama.cpp Releases·原文 2026年10月3日

llama.cpp发布b11370:CUDA后端将共享专家融合进MMVQ

llama.cpp新版本b11370的发布说明显示,CUDA后端新增“将共享专家融合进MMVQ”的改动(PR #29184),发布页同时列出各平台预编译包。

llama.cpp发布b11370,发布说明中唯一的改动条目为“CUDA: fuse shared experts into MMVQ (#29184)”。

发布说明列出的提交要点包括:检查缓冲区是否为空、把stride_col_dst移入融合参数。

本次改动内容

发布说明将该版本标记为CUDA后端改动:把共享专家(shared experts)融合进MMVQ,对应PR #29184。说明中列出的三个提交要点为:CUDA: fuse shared experts into MMVQ;check if buffer is null;move stride_col_dst to fusion args。

提供的构建产物

发布页按平台列出可下载的预编译包,涵盖macOS/iOS、Linux、Android、Windows与openEuler。其中macOS Apple Silicon的KleidiAI启用版本标注为DISABLED,openEuler各包同样标注为DISABLED。

  • macOS:Apple Silicon (arm64)、Intel (x64)、iOS XCFramework。
  • Linux:Ubuntu x64/arm64/s390x CPU、Vulkan(x64/arm64)、CUDA 12(x64,含CUDA 12.8库)、CUDA 13(x64/arm64,CUDA 13.4及库)、ROCm 10.0 (x64)、OpenVINO 2026.4 (x64)、SYCL FP32/FP16 (x64)、Linux arm64 Snapdragon(CPU、Adreno GPU、Hexagon NPU)。
  • Android:arm64 CPU、arm64 Snapdragon(CPU、Adreno GPU、Hexagon NPU)。
  • Windows:x64/arm64 CPU、arm64 OpenCL Adreno、CUDA 12(x64,含 12.4 DLL)、CUDA 13(x64/arm64,含 13.4 DLL)、Vulkan (x64)、OpenVINO 2026.4 (x64)、SYCL (x64)、ROCm 10.0 (x64)。
  • 其他:UI包;openEuler x86/aarch64的 310p与 910b(ACL Graph)均标注DISABLED。

信息来源

llama.cpp Releases原始来源