llama.cpp b11326发布:用FILL清理非活跃AllReduce分片
llama.cpp新构建b11326合并 #29793,把清理非活跃AllReduce分片的操作从SCALE改为FILL,同时继续提供覆盖macOS、Linux、Windows、Android的预编译包。
llama.cpp发布b11326构建,对应提交信息为“meta: clear inactive AllReduce shards with FILL, not SCALE (#29793)”。
这一版没有其他功能描述,变更点集中在非活跃AllReduce分片的清理方式:由SCALE改为FILL。
发布页同时列出了各平台预编译包,覆盖macOS、iOS、Linux、Android、Windows和openEuler,包含CPU以及CUDA、Vulkan、ROCm、SYCL、OpenVINO等后端。
其中macOS Apple Silicon的KleidiAI版本标记为DISABLED,openEuler的x86与aarch64构建也标记为DISABLED。
变更内容:AllReduce非活跃分片清理改用FILL
b11326的唯一提交信息是“meta: clear inactive AllReduce shards with FILL, not SCALE (#29793)”。按字面理解,这是把清理非活跃AllReduce分片时使用的操作从SCALE换成FILL。
发布说明没有解释这一改动的动机、影响范围或性能预期,因此无法判断它对具体多设备推理场景的实际效果。
预编译包平台与后端清单
发布页给出了b11326的下载包,按平台分列。
- macOS/iOS:macOS Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework;macOS Apple Silicon(arm64,KleidiAI启用版)标记为DISABLED。
- Linux:Ubuntu x64/arm64/s390x(CPU)、Ubuntu x64/arm64(Vulkan)、Ubuntu x64(CUDA 12.8)、Ubuntu x64/arm64(CUDA 13.4)、Ubuntu x64(ROCm 10.0)、Ubuntu x64(OpenVINO 2026.4)、Ubuntu x64(SYCL FP32/FP16)、Linux arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU)。
- Android:Android arm64(CPU)、Android arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU)。
- Windows:x64/arm64(CPU)、arm64(OpenCL Adreno)、x64(CUDA 12.4)、x64/arm64(CUDA 13.4)、x64(Vulkan)、x64(OpenVINO 2026.4)、x64(SYCL)、x64(ROCm 10.0)。
- openEuler:x86(310p)、x86(910b,ACL Graph)、aarch64(310p)、aarch64(910b,ACL Graph)均标记为DISABLED。
- 另提供UI包。