llama.cpp发布b11370:CUDA后端将共享专家融合进MMVQ
llama.cpp新版本b11370的发布说明显示,CUDA后端新增“将共享专家融合进MMVQ”的改动(PR #29184),发布页同时列出各平台预编译包。
llama.cpp发布b11370,发布说明中唯一的改动条目为“CUDA: fuse shared experts into MMVQ (#29184)”。
发布说明列出的提交要点包括:检查缓冲区是否为空、把stride_col_dst移入融合参数。
本次改动内容
发布说明将该版本标记为CUDA后端改动:把共享专家(shared experts)融合进MMVQ,对应PR #29184。说明中列出的三个提交要点为:CUDA: fuse shared experts into MMVQ;check if buffer is null;move stride_col_dst to fusion args。
提供的构建产物
发布页按平台列出可下载的预编译包,涵盖macOS/iOS、Linux、Android、Windows与openEuler。其中macOS Apple Silicon的KleidiAI启用版本标注为DISABLED,openEuler各包同样标注为DISABLED。
- macOS:Apple Silicon (arm64)、Intel (x64)、iOS XCFramework。
- Linux:Ubuntu x64/arm64/s390x CPU、Vulkan(x64/arm64)、CUDA 12(x64,含CUDA 12.8库)、CUDA 13(x64/arm64,CUDA 13.4及库)、ROCm 10.0 (x64)、OpenVINO 2026.4 (x64)、SYCL FP32/FP16 (x64)、Linux arm64 Snapdragon(CPU、Adreno GPU、Hexagon NPU)。
- Android:arm64 CPU、arm64 Snapdragon(CPU、Adreno GPU、Hexagon NPU)。
- Windows:x64/arm64 CPU、arm64 OpenCL Adreno、CUDA 12(x64,含 12.4 DLL)、CUDA 13(x64/arm64,含 13.4 DLL)、Vulkan (x64)、OpenVINO 2026.4 (x64)、SYCL (x64)、ROCm 10.0 (x64)。
- 其他:UI包;openEuler x86/aarch64的 310p与 910b(ACL Graph)均标注DISABLED。