llama.cpp b11073发布:SYCL后端合并MKL-FA softmax加载
这次构建的主要代码变更是SYCL后端重新组织MKL-FA softmax的加载方式,把原先每行一个work-item改为合并处理;发行页同时仍按平台列出macOS、Linux、Windows、Android等预编译包。
llama.cpp发布b11073构建,发行页记录的代码变更只有一项:SYCL后端合并MKL-FA softmax的加载,替代此前每行分配一个work-item的做法(PR #28918)。
同一PR中还有一处变量重命名,说明称是为了让变量名更易读。发行页未提供性能数字、基准测试或受影响的模型类型。
SYCL后端改了什么
PR #28918 的标题是 “sycl : coalesce MKL-FA softmax loads instead of one work-item per row”。按字面意思,SYCL后端的MKL-FA(flash attention)softmax加载从“每一行一个work-item”改为合并加载。
发行说明同时提到把某个变量名改得更易读,但没有说明涉及哪些具体变量。除这两点外,该版本没有列出其他代码改动。
- 变更范围:SYCL后端
- 变更内容:合并MKL-FA softmax加载,不再每行一个work-item
- 附带改动:变量重命名以提升可读性
- 未提供:速度对比、显存占用变化、适用模型或量化格式
随版本提供的预编译包
发行页按平台列出了b11073的二进制产物。macOS侧有Apple Silicon(arm64)和Intel(x64)两个包,另有iOS的XCFramework;其中“Apple Silicon启用KleidiAI”的构建被标记为DISABLED。
Linux侧提供Ubuntu的CPU(x64、arm64、s390x)、Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO 2026.4以及SYCL FP32、SYCL FP16包,并单独提供CUDA 12.8和CUDA 13.4的运行时库。Android只有arm64 CPU包。
- Windows:CPU(x64、arm64)、OpenCL Adreno(arm64)、CUDA 12.4、CUDA 13.4(x64、arm64)、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0
- macOS/iOS:Apple Silicon arm64、Intel x64、iOS XCFramework;KleidiAI构建为DISABLED
- Linux:Ubuntu CPU、Vulkan、CUDA 12.8/13.4、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16
- Android:arm64 CPU
- 另有UI包
- openEuler构建标注为DISABLED,包括x86与aarch64的 310p、910b(ACL Graph)
这条更新适合谁
由于改动集中在SYCL后端,最直接的受众是使用SYCL构建在Intel GPU等设备上跑llama.cpp的用户;他们可以从b11073的SYCL包(Linux有FP32与FP16两个版本,Windows有SYCL x64)获取这次实现变化。
使用CUDA、ROCm、Vulkan、Metal或纯CPU路径的用户,发行页没有说明这次改动会给他们带来变化。发行说明也没有给出任何性能提升幅度,因此不能从这次发布推断速度改善的具体数值。
- 主要相关:使用SYCL后端的用户
- 无关或影响未说明:CUDA、ROCm、Vulkan、Metal、纯CPU路径
- 没有公开的效果数据:不宣称加速比例