开源llama.cpp Releases·原文 2026年9月26日

llama.cpp b11183将Metal FlashAttention内核按数据类型拆分为独立库

llama.cpp发布b11183构建,主要改动是把Metal的FA(FlashAttention)内核按数据类型拆分成独立库,同步提供macOS、iOS、Linux、Android、Windows等多平台预编译包。

AI解读:发布说明没有给出性能数字或前后对比,只说做了一次注释方面的小修正。因此这次更新目前能确认的是打包结构变化,至于具体带来多少编译时间、二进制体积或推理速度的变化,来源没有提供,不能替它下结论。

对使用预编译包的人来说,实际变化是下载链接按平台和加速后端重新排列,macOS Apple Silicon、macOS Intel、iOS XCFramework,以及带Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL的Ubuntu和Windows包都在同一批发布中。有需要的用户按自己平台选对应压缩包即可。

llama.cpp发布b11183构建,发布说明中列出的代码改动只有一项:Metal后端把FA(FlashAttention)内核按数据类型拆分为独立的库(提交 #29329),并附带一处注释的小修正。

该版本由github-actions[bot] 发布,提交说明中标注Assisted-by: pi:llama.cpp/DeepSeek-V4-Flash-Vision-Exp。

发布页同时给出各平台的预编译产物,覆盖macOS、iOS、Linux、Android和Windows,以及CUDA、Vulkan、ROCm、OpenVINO、SYCL等多种加速后端。

来源只包含构建说明与下载清单,没有提供性能对比数据,也没有说明拆库后对编译时间、包体积或推理速度的具体影响。

发布的平台与后端包

b11183的产物按操作系统和加速后端分列,官方给出的压缩包涵盖以下范围。

  • macOS/iOS:macOS Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework;其中macOS Apple Silicon的KleidiAI版本标注为DISABLED。
  • Linux:Ubuntu x64/arm64/s390x CPU、Ubuntu x64/arm64 Vulkan、Ubuntu x64 CUDA 12.8、Ubuntu x64/arm64 CUDA 13.4、Ubuntu x64 ROCm 10.0、Ubuntu x64 OpenVINO 2026.4、Ubuntu x64 SYCL FP32与FP16,以及Linux arm64的骁龙包(CPU、Adreno GPU、Hexagon NPU)。
  • Android:arm64 CPU包,以及骁龙(CPU、Adreno GPU、Hexagon NPU)包,均附有安装指南链接。
  • Windows:x64/arm64 CPU、arm64 OpenCL Adreno、x64 CUDA 12.4(含DLL)、x64/arm64 CUDA 13.4(含DLL)、x64 Vulkan、x64 OpenVINO 2026.4、x64 SYCL、x64 ROCm 10.0。
  • openEuler:x86与aarch64的 310p、910b(ACL Graph)包均标注为DISABLED。
  • 另提供独立的UI包(llama-b11183-ui.tar.gz)。

已知的限制

除Metal FA内核拆分外,发布说明没有列出其他功能改动,也没有给出任何性能、兼容性或行为变化的说明。

两个方向明确不可用或被关闭:macOS Apple Silicon的KleidiAI版本链接指向DISABLED的PR #23780,openEuler相关包链接指向DISABLED的PR #23705。

信息来源

llama.cpp Releases原始来源