开源llama.cpp Releases·原文 2026年9月23日本站收录 2026年9月24日

llama.cpp b11124发布:修复CUDA后端top-k MoE触发问题

该版本的主要代码变更是让CUDA后端的top-k MoE路由“始终触发”,同时按平台更新了macOS、Linux、Windows、Android等预编译包。

AI解读:这次发布的核心是一条CUDA后端修复:top-k MoE应当始终触发。MoE(混合专家)模型推理时,每个token只会被路由到少数几个专家,top-k决定选几个;如果这条路径没有按预期触发,就会影响CUDA上的MoE推理行为。修复提交号为 #28432。

对直接跑llama.cpp的人来说,如果你在NVIDIA GPU上用CUDA后端加载MoE架构模型,这个版本值得替换。非MoE模型或不用CUDA后端的用户,这个改动对你们基本没有影响。

发布页同时给出了各平台的预编译包下载链接,覆盖macOS、iOS、Linux、Windows、Android以及openEuler。其中macOS Apple Silicon的KleidiAI加速版本仍处于DISABLED状态,openEuler的四个构建也标记为DISABLED,只能从对应PR查看原因,发布页没有给出说明。

llama.cpp发布b11124版本,主要代码变更为“cuda: top-k MoE should always fire”,即让CUDA后端的top-k MoE路径始终触发,对应提交 #28432。

发布页按平台提供了预编译产物:macOS/iOS包括macOS Apple Silicon(arm64)、macOS Intel(x64)和iOS XCFramework;其中macOS Apple Silicon的KleidiAI加速版本标注为DISABLED,链接指向PR #23780。

Linux侧包括Ubuntu x64、arm64、s390x的CPU构建,Vulkan的x64/arm64构建,CUDA 12(12.8)与CUDA 13(13.4)的x64/arm64构建及对应CUDA运行库,以及ROCm 10.0、OpenVINO 2026.4、SYCL FP32和SYCL FP16的x64构建,另有面向Snapdragon的Linux arm64包(CPU、Adreno GPU、Hexagon NPU)。

Android侧提供arm64的CPU包,以及面向Snapdragon的arm64包(CPU、Adreno GPU、Hexagon NPU)。

Windows侧提供x64/arm64的CPU包、Windows arm64的OpenCL Adreno包、CUDA 12(12.4)与CUDA 13(13.4)的x64/arm64包及DLL、Vulkan x64包、OpenVINO 2026.4 x64包、SYCL x64包和ROCm 10.0 x64包。

openEuler的x86 310p、x86 910b(ACL Graph)、aarch64 310p、aarch64 910b(ACL Graph)四个构建均标注为DISABLED,指向PR #23705;UI包单独提供。以上内容依据的是该发布页摘要所列的变更与产物清单。

信息来源

llama.cpp Releases原始来源