开源llama.cpp Releases·原文 2026年9月21日本站收录 2026年9月22日

llama.cpp b11073发布:SYCL后端合并MKL-FA softmax加载

这次构建的主要代码变更是SYCL后端重新组织MKL-FA softmax的加载方式,把原先每行一个work-item改为合并处理;发行页同时仍按平台列出macOS、Linux、Windows、Android等预编译包。

llama.cpp发布b11073构建,发行页记录的代码变更只有一项:SYCL后端合并MKL-FA softmax的加载,替代此前每行分配一个work-item的做法(PR #28918)。

同一PR中还有一处变量重命名,说明称是为了让变量名更易读。发行页未提供性能数字、基准测试或受影响的模型类型。

SYCL后端改了什么

PR #28918 的标题是 “sycl : coalesce MKL-FA softmax loads instead of one work-item per row”。按字面意思,SYCL后端的MKL-FA(flash attention)softmax加载从“每一行一个work-item”改为合并加载。

发行说明同时提到把某个变量名改得更易读,但没有说明涉及哪些具体变量。除这两点外,该版本没有列出其他代码改动。

  • 变更范围:SYCL后端
  • 变更内容:合并MKL-FA softmax加载,不再每行一个work-item
  • 附带改动:变量重命名以提升可读性
  • 未提供:速度对比、显存占用变化、适用模型或量化格式

随版本提供的预编译包

发行页按平台列出了b11073的二进制产物。macOS侧有Apple Silicon(arm64)和Intel(x64)两个包,另有iOS的XCFramework;其中“Apple Silicon启用KleidiAI”的构建被标记为DISABLED。

Linux侧提供Ubuntu的CPU(x64、arm64、s390x)、Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO 2026.4以及SYCL FP32、SYCL FP16包,并单独提供CUDA 12.8和CUDA 13.4的运行时库。Android只有arm64 CPU包。

  • Windows:CPU(x64、arm64)、OpenCL Adreno(arm64)、CUDA 12.4、CUDA 13.4(x64、arm64)、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0
  • macOS/iOS:Apple Silicon arm64、Intel x64、iOS XCFramework;KleidiAI构建为DISABLED
  • Linux:Ubuntu CPU、Vulkan、CUDA 12.8/13.4、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16
  • Android:arm64 CPU
  • 另有UI包
  • openEuler构建标注为DISABLED,包括x86与aarch64的 310p、910b(ACL Graph)

这条更新适合谁

由于改动集中在SYCL后端,最直接的受众是使用SYCL构建在Intel GPU等设备上跑llama.cpp的用户;他们可以从b11073的SYCL包(Linux有FP32与FP16两个版本,Windows有SYCL x64)获取这次实现变化。

使用CUDA、ROCm、Vulkan、Metal或纯CPU路径的用户,发行页没有说明这次改动会给他们带来变化。发行说明也没有给出任何性能提升幅度,因此不能从这次发布推断速度改善的具体数值。

  • 主要相关:使用SYCL后端的用户
  • 无关或影响未说明:CUDA、ROCm、Vulkan、Metal、纯CPU路径
  • 没有公开的效果数据:不宣称加速比例

信息来源

llama.cpp Releases原始来源