llama.cpp发布b11402:CUDA后端改用整tile FlashAttention调度
该版本唯一列出的代码变更是CUDA的FlashAttention调度调整(#29435),倾向整tile调度以配合两阶段kernel;发布页同时提供各平台预编译包。
AI解读:该变更的表述是“prefer whole-tile FlashAttention scheduling for efficient two-stage kernels”,即偏好整tile调度以适配两阶段kernel。
发布页没有给出性能对比数据、基准测试或适用GPU型号说明,也未说明该调度是否成为默认行为。
随版本提供的预编译包覆盖macOS/iOS、Linux、Android、Windows,以及CUDA 12/13、Vulkan、ROCm 10.0、SYCL、OpenVINO等后端。
macOS Apple Silicon的KleidiAI构建被标记为DISABLED,openEuler构建同样被标记为DISABLED。
发布由github-actions[bot] 自动生成,未附其他改动说明或破坏性变更提示。
llama.cpp发布构建b11402,发布说明中唯一列出的代码变更是CUDA后端的FlashAttention调度调整,对应PR #29435,描述为“prefer whole-tile FlashAttention scheduling for efficient two-stage kernels”。
发布页由github-actions[bot] 生成,除该条目外未列出其他代码改动。
CUDA调度变更的范围
变更对象是CUDA后端的FlashAttention调度策略,方向是偏好整tile调度,用途是配合两阶段kernel。发布说明没有说明这项调整会多大程度上改变性能,也没有给出测试数据或对比结果,因此只能确认调度策略的表述,不能据此推断速度提升幅度。
发布说明未写明适用的GPU架构或CUDA版本限制,也未说明该调度是默认启用还是需要手动选择。
- 变更:CUDA偏好整tile FlashAttention调度
- 目的(据发布说明):适配高效两阶段kernel
- PR编号:#29435
- 性能影响:发布说明未提供数据
同版本附带的构建产物
b11402同时发布了多平台预编译包,涵盖桌面、移动端和后端加速版本。其中macOS Apple Silicon的KleidiAI构建被标记为DISABLED,openEuler构建整体也被标记为DISABLED。
- macOS:Apple Silicon(arm64)、Intel(x64)、iOS XCFramework
- Linux/Ubuntu:CPU(x64、arm64、s390x)、Vulkan、CUDA 12(12.8)、CUDA 13(13.4,x64与arm64)、ROCm 10.0、OpenVINO、SYCL(FP32、FP16)
- Linux arm64 Snapdragon:CPU、Adreno GPU、Hexagon NPU
- Android arm64:CPU,以及Snapdragon版(CPU、Adreno GPU、Hexagon NPU)
- Windows:CPU(x64、arm64)、OpenCL Adreno、CUDA 12(12.4)、CUDA 13(13.4,x64与arm64)、Vulkan、OpenVINO、SYCL、ROCm 10.0
- UI:单独的UI打包文件
- 标记为DISABLED:macOS Apple Silicon KleidiAI构建(关联PR #23780)、openEuler(关联PR #23705)