开源llama.cpp Releases·原文 2026年10月5日

llama.cpp b11424修复Vulkan后端Flash Attention共享内存越界写

llama.cpp发布b11424版本,其唯一列出的变更是“vulkan: fix Flash Attention shmem write out of bounds (#29988)”,即修复Vulkan后端Flash Attention的共享内存越界写入;该版本同时提供多平台预编译二进制。

AI解读:这个版本与llama.cpp常规构建发布一样,变更说明只有一条:Vulkan后端的Flash Attention共享内存越界写被修复,对应PR编号 #29988。

受影响的路径是Vulkan后端下的Flash Attention实现;其他后端(CUDA、ROCm、SYCL、OpenVINO、CPU等)不在该修复的描述范围内。

来源没有说明该越界写会触发什么具体症状、影响哪些模型或算力条件,也没有给出性能或正确性测试数据,因此无法判断运行时风险等级。

b11424同时按平台提供预编译包:macOS(arm64、x64)、iOS XCFramework、Linux多种CPU与GPU后端、Android arm64、Windows x64/arm64等;其中macOS arm64的KleidiAI启用版本和openEuler构建被标注为DISABLED。

llama.cpp发布构建版本b11424,发布页列出的唯一代码变更是“vulkan: fix Flash Attention shmem write out of bounds (#29988)”,即修复Vulkan后端Flash Attention的共享内存越界写入问题。

该发布同时提供各平台预编译二进制,包括macOS、iOS、Linux、Android、Windows和UI等条目。

修复内容与适用范围

发布说明把变更范围限定在Vulkan后端的Flash Attention实现,修复的是共享内存越界写。来源没有进一步描述触发条件、受影响模型规模或可见后果。

同一发布还列出KleidiAI启用版macOS arm64构建和openEuler相关构建被标注为DISABLED,这与Vulkan修复是两条独立信息。

  • 变更说明:vulkan: fix Flash Attention shmem write out of bounds (#29988)
  • 修复对象:Vulkan后端的Flash Attention共享内存写入越界
  • 来源未提供:症状、触发场景、性能或正确性对比数据

可用构建

b11424的预编译产物覆盖macOS/iOS、Linux、Android和Windows。Linux侧包含CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL以及Snapdragon的CPU/Adreno GPU/Hexagon NPU构建;Windows侧包含CPU、Vulkan、CUDA 12.4/13.4、OpenCL Adreno、OpenVINO、SYCL和ROCm 10.0构建。

Android提供arm64 CPU与Snapdragon三种加速单元组合的构建;发布页另附Snapdragon在Linux和Android上的设置指南链接。

  • macOS:Apple Silicon arm64、Intel x64、iOS XCFramework;arm64 KleidiAI版本标注DISABLED
  • Linux:Ubuntu x64/arm64/s390x CPU,以及Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL FP32/FP16、Snapdragon等构建
  • Windows:x64/arm64 CPU,Vulkan、CUDA 12.4/13.4、OpenCL Adreno、OpenVINO、SYCL、ROCm 10.0等构建
  • Android:arm64 CPU和Snapdragon CPU/Adreno GPU/Hexagon NPU构建
  • 其他:openEuler构建标注DISABLED,另有独立UI包

信息来源

llama.cpp Releases原始来源