llama.cpp发布b10900:Vulkan后端借add_alloc_dep为预填充启用topk_moe融合
该版本说明(来源仅为发布页摘要)写明唯一改动是Vulkan后端使用add_alloc_dep让topk_moe融合在预填充(prefill)阶段生效(PR #28422),同时照例提供各平台预编译包。
AI解读:这次llama.cpp的更新只做了一件事:让Vulkan后端在预填充阶段也能用上topk_moe融合。做法是引入add_alloc_dep来表达内存分配之间的依赖,从而让融合在Vulkan上成立。
受影响的是用Vulkan显卡(而不是CUDA、ROCm或纯CPU)跑MoE模型、并且在意长提示词预填充速度的人。所谓融合,就是把原本分开的算子合并执行,减少中间开销和内存搬运——理论上预填充更快,但发布说明没有给任何速度数字。
对大多数人,这次更新不必特别处理:不用Vulkan后端,或模型不是MoE架构,就感受不到变化。预编译包仍覆盖macOS、Linux、Windows、Android等平台,但macOS上KleidiAI版本和openEuler构建在本次发布中标记为DISABLED。
需要留意的是,本次依据仅为发布页摘要,除“启用topk_moe融合”这一改动描述和平台包清单外,没有提供性能数据、适用模型列表或限制说明。
llama.cpp发布构建b10900。发布页摘要列出的改动只有一条:Vulkan后端使用add_alloc_dep,为预填充(prefill)启用topk_moe融合(PR #28422)。
该构建照例提供各平台预编译包:macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework,Linux下的Ubuntu x64/arm64/s390x(CPU)以及Ubuntu x64、arm64的Vulkan包,另有ROCm 10.0、OpenVINO 2026.3.1、SYCL FP32/FP16等版本,Android arm64(CPU),以及Windows的CPU、OpenCL Adreno、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm 10.0等版本。
发布页标注macOS Apple Silicon(arm64,启用KleidiAI)与openEuler相关的构建为DISABLED。