开源llama.cpp Releases·原文 2026年9月25日

llama.cpp b11179发布:SYCL后端支持稀疏Flash Attention

该版本为Intel GPU的SYCL后端加入sparse FA支持,同时继续提供覆盖macOS、Windows、Linux、Android的多后端预编译包。

AI解读:这条更新对使用Intel GPU并通过SYCL路径跑llama.cpp的人有直接影响:稀疏注意力此前在该后端不可用,现在被补上;其余平台的预编译包照常发布。

改动明细只有PR标题和几条修复日志——修冲突、修格式、删无用代码,仓库没有给出性能数字或适用条件,所以实际加速幅度和是否默认启用都还没有公开依据。

对普通用户来说不必急着换版本,除非你正好在SYCL上跑长上下文推理;否则继续用现有构建即可。

llama.cpp发布b11179构建,代号PR #28796 的改动让SYCL后端开始支持sparse FA(稀疏Flash Attention)。

发布页同步列出了macOS、iOS、Linux、Windows、Android各平台的预编译包,涵盖CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL FP32/FP16以及Snapdragon的CPU、Adreno GPU和Hexagon NPU等后端。

PR #28796 的提交说明仅包含三类改动:修复冲突、修复格式问题、移除未使用代码。

SYCL后端新增sparse FA支持

PR #28796 的标题为“[SYCL] support sparse FA”,即让SYCL后端支持稀疏Flash Attention。该PR的附注列出三项操作:fix conflict(修复冲突)、fix format issue(修复格式问题)、rm unused code(移除未使用代码)。

发布页没有说明sparse FA的默认开启状态、适用的模型或上下文长度,也没有给出性能对比数据。

  • PR编号:#28796
  • 改动类型:SYCL后端支持sparse FA
  • 附带提交说明:修复冲突、修复格式、移除未使用代码

预编译包覆盖范围

b11179的发布资产按平台分组。macOS/iOS提供Apple Silicon(arm64)、Intel(x64)和iOS XCFramework;其中“macOS Apple Silicon(arm64, KleidiAI enabled)”一项标注为DISABLED,指向PR #23780。

Linux侧提供Ubuntu x64/arm64/s390x的CPU包,以及Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO 2026.4和SYCL FP32/FP16包,另含CUDA 12.8与CUDA 13.4的运行时库;还有面向Snapdragon的Linux arm64包,包含CPU、Adreno GPU、Hexagon NPU三种路径,并附有安装指南。

Windows侧提供x64/arm64的CPU包,arm64的OpenCL Adreno包,以及CUDA 12.4、CUDA 13.4(x64和arm64)、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0等构建;CUDA 12.4和 13.4 另有对应的DLL包。

Android提供arm64的CPU包和Snapdragon包(CPU、Adreno GPU、Hexagon NPU)。openEuler的x86/arm64构建在本次发布中标记为DISABLED,指向PR #23705。UI单独提供llama-b11179-ui.tar.gz。

  • macOS:Apple Silicon arm64、Intel x64、iOS XCFramework;KleidiAI版标注DISABLED
  • Ubuntu:CPU(x64/arm64/s390x)、Vulkan、CUDA 12.8/13.4、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16
  • Windows:CPU(x64/arm64)、OpenCL Adreno arm64、CUDA 12.4/13.4、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0
  • Android:arm64 CPU与Snapdragon包
  • openEuler:x86/arm64构建标记为DISABLED

信息来源

llama.cpp Releases原始来源