开源llama.cpp Releases·原文 2026年10月2日

llama.cpp发布b11344:修复两个Volta架构CUDA闪存注意力失效用例

该版本由CI机器人自动发布,唯一代码改动是CUDA后端针对Volta显卡的FA(闪存注意力)修复,同时按惯例更新了覆盖macOS、Linux、Windows、Android的多平台预编译包。

AI解读:这条新闻的实质是一次常规的版本滚动:llama.cpp发布了b11344构建,核心代码改动只有一行——修复CUDA后端在Volta架构上两个失效的闪存注意力(FA)用例。

真正受影响的是还在用Volta一代显卡(如V100、Titan V)跑量化模型推理、并且启用了FA的人;对使用更新架构显卡或纯CPU推理的用户,这次更新基本不改变使用方式。

需要注意的是,来源仅为发布页摘要,只给出PR编号(#29803)和一句描述,没有说明故障的具体表现、触发条件或修复后的实测数据,因此无法判断这些问题在实际使用中的出现频率和严重程度。

发布页同时列出了各平台预编译产物,包括CUDA 12.8/13.4、ROCm 10.0、Vulkan、SYCL、OpenVINO等后端选项;macOS的KleidiAI构建和openEuler构建处于禁用状态。

llama.cpp发布b11344构建,发布说明中唯一的代码改动是CUDA后端修复两个在Volta架构上失效的闪存注意力(FA)用例,对应PR #29803。

该发布由github-actions[bot] 生成,除这一处修复外,主要变化是随版本更新的各平台预编译包链接。

CUDA修复只针对Volta的FA用例

发布说明正文只有一行:CUDA: fix 2 broken Volta FA cases (#29803)。这里没有说明两个用例原本如何失败、在什么输入或模型配置下触发,也没有给出修复前后的性能或正确性数据。

按字面理解,改动落在CUDA后端的闪存注意力实现上,影响对象是Volta架构GPU(例如V100、Titan V)上启用FA的场景。其他架构是否受同一问题影响、问题是否会导致输出错误还是直接报错,发布页均未提及。

  • 改动内容:修复 2 个失效的Volta FA用例
  • 关联PR:#29803
  • 影响组件:CUDA后端 / 闪存注意力(FA)
  • 来源限制:发布说明未给出故障复现条件与测试结果

随版本更新的预编译产物

除代码修复外,b11344按惯例提供了一批可直接下载的预编译包,覆盖macOS/iOS、Linux、Android、Windows。CUDA线有两个版本:Linux侧为CUDA 12.8与CUDA 13.4,Windows侧为CUDA 12.4与CUDA 13.4,并分别附带对应的cudart运行库压缩包。

非NVIDIA后端方面,发布页列出了Vulkan(Ubuntu x64/arm64、Windows x64)、ROCm 10.0(Ubuntu x64、Windows x64)、SYCL(FP32与FP16,Ubuntu x64;Windows x64一个包)、OpenVINO 2026.4(Ubuntu x64、Windows x64)。

移动与ARM平台方面,有Android arm64的CPU包和针对骁龙(CPU、Adreno GPU、Hexagon NPU)的包,以及Linux arm64的骁龙对应包;Windows arm64提供CPU、OpenCL Adreno和CUDA 13.4三种。macOS提供Apple Silicon arm64与Intel x64两种,另有iOS XCFramework。UI也单独打包为tar.gz。

  • macOS Apple Silicon的KleidiAI构建标注为DISABLED,指向PR #23780
  • openEuler构建同样标注为DISABLED,指向PR #23705
  • 骁龙平台附有单独的Linux与Android安装指南链接

信息来源

llama.cpp Releases原始来源