开源llama.cpp Releases·原文 2026年9月25日

llama.cpp发布b11172:优化Metal后端稀疏注意力并清理代码

llama.cpp发布版本b11172,主要改动为Metal后端的稀疏Flash Attention优化与代码清理,提交编号 #29377。

AI解读:这个版本只做了一件核心的事:让Mac和iOS设备上的稀疏注意力算得更省事。具体做法是把稀疏FA的索引缓存在共享内存里,简化共享内存大小的计算方式,并展开稀疏索引的加载循环。

对跑本地大模型的人来说,这类改动的意义在于Metal后端的推理路径被理顺了。改动本身不涉及新模型或新功能,属于底层性能与代码整洁度的维护。

发布页同时列出各平台预编译包,覆盖macOS、iOS、Linux、Windows、Android,以及CUDA、Vulkan、ROCm、SYCL、OpenVINO等后端;说明依据是版本发布页摘要,未展开每项构建的具体变化。

llama.cpp发布b11172版本,对应提交 #29377,主题是“metal : optimize sparse FA + clean-up”。

Metal后端稀疏Flash Attention做了三处改动

根据发布说明,这次改动包括:在共享内存中缓存稀疏FA索引;简化共享内存大小的计算;展开(unroll)稀疏索引的加载。

提交信息把上述改动标注为“优化sparse FA +清理”,并列出Assisted-by: pi:llama.cpp/DeepSeek-V4-Flash-Vision-Exp作为协助来源。

  • 在共享内存中缓存稀疏FA索引
  • 简化共享内存大小计算
  • 展开稀疏索引加载

b11172提供的预编译包

发布页列出了多平台构建产物,涵盖macOS、iOS、Linux、Android、Windows与openEuler。

  • macOS:Apple Silicon (arm64)、Intel (x64),以及iOS XCFramework;其中启用KleidiAI的macOS Apple Silicon构建标注为DISABLED,指向PR #23780
  • Linux:Ubuntu x64 / arm64 / s390x(CPU)、x64与arm64(Vulkan)、CUDA 12.8与CUDA 13.4、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16,以及Snapdragon(CPU、Adreno GPU、Hexagon NPU)
  • Android:arm64(CPU)与arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU)
  • Windows:x64与arm64(CPU)、arm64(OpenCL Adreno)、CUDA 12.4与CUDA 13.4、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0
  • openEuler构建标注为DISABLED,指向PR #23705

信息来源

llama.cpp Releases原始来源