开源llama.cpp Releases·原文 2026年9月25日

llama.cpp b11166发布:CUDA后端为CONV_2D_DW增加F16内核支持

llama.cpp发布b11166版本,主要变更是CUDA后端为CONV_2D_DW算子加入F16内核支持(#29064),同时照例提供覆盖macOS、Linux、Windows、Android的多后端预编译包。

llama.cpp发布b11166版本,主要变更是一条CUDA后端改动:为CONV_2D_DW算子增加F16内核支持,对应PR #29064。发布说明没有提供性能或精度数据。

该版本照例附带各平台预编译产物,覆盖macOS、iOS、Linux、Windows、Android以及Snapdragon的CPU、GPU、NPU组合,并提供CUDA 12.8/13.4、ROCm 10.0、Vulkan、OpenVINO、SYCL等后端构建。

CUDA后端为CONV_2D_DW补上F16内核

b11166版本的发布标题即为“cuda : add F16 kernel support for CONV_2D_DW (#29064)”,说明这是一次针对CUDA后端的算子级改动。CONV_2D_DW指二维深度卷积(depthwise convolution),是深度可分离卷积的组成部分,多见于视觉类模型。

加入F16内核意味着该算子在CUDA上新增一种半精度执行路径。发布说明未说明此前的具体行为、也未给出吞吐或精度对比,因此这项改动对具体模型的实际影响需要使用者自行测试。

  • 变更内容:CUDA后端新增CONV_2D_DW的F16内核支持
  • PR编号:#29064
  • 发布说明未提供性能与精度数据

预编译产物与部分被禁用的构建

发布页列出了b11166的全部预编译包。macOS/iOS侧包含Apple Silicon arm64、Intel x64以及iOS XCFramework;其中Apple Silicon的KleidiAI加速版本标注为DISABLED,并指向PR #23780。

Linux侧覆盖Ubuntu x64/arm64/s390x的CPU构建,以及Vulkan、CUDA 12(12.8 库)、CUDA 13(13.4 库)、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16构建;另有Linux arm64的Snapdragon包(CPU、Adreno GPU、Hexagon NPU)及安装指南。

Windows侧包含x64/arm64 CPU、OpenCL Adreno、CUDA 12.4、CUDA 13.4(含arm64)、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0等构建。Android提供arm64 CPU与Snapdragon组合包。openEuler构建整体标注为DISABLED,指向PR #23705。

  • macOS Apple Silicon(arm64)与Intel(x64)、iOS XCFramework
  • Ubuntu:CPU(x64/arm64/s390x)、Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16
  • Windows:CPU(x64/arm64)、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0、OpenCL Adreno
  • Android arm64与Snapdragon(CPU/Adreno GPU/Hexagon NPU)
  • KleidiAI版macOS构建与openEuler构建标注DISABLED

信息来源

llama.cpp Releases原始来源