开源llama.cpp Releases·原文 2026年9月22日

llama.cpp发布b11093:修复Metal闪存注意力掩码边界

llama.cpp发布b11093版本,核心改动是修复Metal后端flash attention块预处理阶段的掩码边界问题(PR #29220),并同步放出macOS、Linux、Windows、Android等多平台预编译包。

llama.cpp发布b11093版本,本次唯一的代码改动记录为:修复Metal后端flash attention块预处理(block pre-pass)阶段的掩码(mask)边界问题,对应PR #29220。

版本号在发布页标题与所有产物文件名中均为b11093;发布说明除该PR标题外未提供更多技术细节。

发布页同时列出了各平台预编译产物,包括macOS Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework、Ubuntu(x64/arm64/s390x,含CPU、Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16等变体)、Android arm64以及Windows(x64/arm64,含CPU、OpenCL Adreno、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0等变体)。

根据发布页标注,macOS Apple Silicon的KleidiAI启用版本与openEuler相关构建处于DISABLED状态,并分别指向PR #23780 与PR #23705。

发布页还提供UI产物与CUDA运行时库(cudart)包,但未附本次修复的具体测试数据或影响范围说明。

信息来源

llama.cpp Releases原始来源