开源llama.cpp Releases·原文 2026年9月15日

llama.cpp构建b10984:CUDA后端支持行连续SUM_ROWS

该版本让GGML_OP_MEAN复用同一共享内核处理行连续张量,并为MEAN的permute/slice增加测试;发布页同时提供macOS、Linux、Windows、Android等多平台预编译包。

AI解读:这次更新改的是llama.cpp的CUDA计算后端:SUM_ROWS现在能处理行连续(row-contiguous)的输入张量。行连续指的是数据在内存里按行挨着存放,过去遇到这种布局可能走不到优化路径。

配套动作有两个:把代码整理后让GGML_OP_MEAN也复用同一个共享内核来处理行连续张量,并给MEAN的permute/slice增加了一个测试。测试的意义在于,这类形状变化容易触发边界问题,有测试才能防止改回去。

受影响的主要是直接用CUDA显卡跑llama.cpp的人,以及依赖同一条ggml计算路径的开发者。普通用户感知到的可能只是某些形状的求和、均值算得更稳,具体提速幅度发布说明没有给数据。

llama.cpp发布构建版本b10984。该版本由github-actions[bot] 在llama.cpp Releases页面发布,主要变更为cuda: support row-contiguous SUM_ROWS(#26308)。

根据发布说明,这项改动让CUDA后端支持行连续(row-contiguous)的SUM_ROWS,也就是处理内存中按行连续排布的输入张量。

同一改动对代码做了整理,并让GGML_OP_MEAN使用同一个共享内核来支持行连续张量。

该PR还为MEAN的permute/slice增加了一个测试,并保留原有注释、新增if/else分支。

发布页按平台列出了预编译构建产物,覆盖macOS Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework,Ubuntu x64/arm64/s390x的CPU版本,以及Vulkan、CUDA 12(12.8)、CUDA 13(13.3)、ROCm 10.0、OpenVINO 2026.3.1、SYCL FP32/FP16等后端,另有Ubuntu arm64的CUDA 13。

Windows侧提供x64/arm64 CPU、arm64 OpenCL Adreno、CUDA 12(12.4)、CUDA 13(13.4)的x64与arm64、Vulkan、OpenVINO 2026.3.1、SYCL、ROCm 10.0等构建;Android提供arm64 CPU构建;另有独立的UI包。macOS Apple Silicon的KleidiAI版本在发布页标记为DISABLED(指向PR #23780),openEuler相关构建也标记为DISABLED(指向PR #23705),列出x86 310p、x86 910b(ACL Graph)、aarch64 310p、aarch64 910b(ACL Graph)。

信息来源

llama.cpp Releases原始来源