llama.cpp发布b11280:SYCL后端用固定主机缓冲减少张量allreduce同步
该版本由GitHub Actions机器人发布,唯一说明的代码改动是SYCL后端PR #29604;同时提供覆盖macOS、Linux、Windows、Android的预编译包,多个后端或平台处于禁用状态。
AI解读:对跑Intel GPU或SYCL后端的人来说,这个版本值得按需替换;对使用CUDA、Vulkan、ROCm等后端的用户,这次发布没有说明相关后端行为变化。
该版本发布说明本身没有给出性能数字,也没有benchmark,所以“减少同步”能否转换成实际生成速度提升,需要在自己的模型和硬件上验证。
发布包覆盖macOS、Linux、Windows、Android多个后端,但macOS Apple Silicon的KleidiAI构建和openEuler全部构建处于禁用状态,说明部分平台暂时没有可用产物。
llama.cpp发布了b11280版本,发布说明中唯一列出的代码改动是“SYCL: reduce tensor allreduce sync with pinned host buffers”(PR #29604),即通过固定主机缓冲减少SYCL后端张量allreduce的同步。
该版本仍由GitHub Actions机器人(github-actions[bot])打包发布,并附带macOS、Linux、Windows、Android等平台及CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL等后端的预编译包下载链接。
说明中未提供该改动的性能数据、适用条件或基准测试结果。以下内容仅依据该发布页面列出的事实整理。
SYCL后端改动:用固定主机缓冲减少allreduce同步
发布说明把b11280的改动描述为“SYCL: reduce tensor allreduce sync with pinned host buffers”,对应PR #29604。
从字面看,改动方向是减少SYCL后端在张量allreduce过程中与主机之间的同步,手段是使用pinned host buffers(固定主机缓冲)。发布说明没有进一步说明实现细节、影响范围或适用硬件。
- 改动标识:SYCL: reduce tensor allreduce sync with pinned host buffers
- PR编号:#29604
- 对应版本:b11280
下载产物覆盖的平台与后端,以及被禁用的部分
发布页面提供了macOS、Linux、Windows、Android等平台的二进制包,Linux侧包括Ubuntu x64、arm64、s390x的CPU构建,以及Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO、SYCL FP32、SYCL FP16等后端构建。
Windows侧包括x64与arm64的CPU构建,以及CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0等后端构建;Android侧包括arm64 CPU与Snapdragon(CPU、Adreno GPU、Hexagon NPU)构建。
macOS侧提供Apple Silicon (arm64) 与Intel (x64) 包,iOS提供XCFramework;Snapdragon构建还附带了Linux与Android的安装指南链接。
- macOS Apple Silicon的KleidiAI构建标注为DISABLED,链接指向PR #23780
- openEuler全部构建标注为DISABLED,链接指向PR #23705,具体包括openEuler x86(310p)、openEuler x86(910b, ACL Graph)、openEuler aarch64(310p)、openEuler aarch64(910b, ACL Graph)
- 发布说明中没有给出各包对应的最低驱动或运行时版本要求,除CUDA 12.8、12.4、13.4 和ROCm 10.0、OpenVINO 2026.4等版本号出现在包名中外