llama.cpp b11157为CUDA后端加入conv3d隐式GEMM
该版本的核心改动是在CUDA后端新增conv3d的隐式GEMM实现,并细化该实现、处理空内核;同时释出覆盖macOS、Linux、Windows、Android与Snapdragon的多平台预编译包。
llama.cpp发布b11157版本。该版本changelog中列出的代码改动只有一项:在CUDA后端新增conv3d的隐式GEMM实现(PR #29137),随后细化该隐式GEMM并处理空内核。
与每次发布一样,b11157附带多平台预编译产物,具体平台与后端条目见下。需要说明的是,以下信息全部来自该版本的发布说明摘要,未包含PR讨论、合并时间或性能数据。
CUDA后端新增conv3d隐式GEMM
发布说明记录的改动标题为“cuda : add conv3d with implicit GEMM (#29137)”。该条目下的两个要点分别是:在CUDA后端加入conv3d的隐式GEMM实现,以及细化conv3d隐式GEMM并处理空内核(handle empty kernels)。
发布说明没有给出该实现的适用模型、精度要求或性能对比数据。
预编译产物覆盖的平台与后端
b11157的发布页列出以下可下载产物。macOS/iOS方面:macOS Apple Silicon (arm64)、macOS Intel (x64)、iOS XCFramework;其中“macOS Apple Silicon (arm64, KleidiAI enabled)”标注为DISABLED,指向PR #23780。
Linux方面:Ubuntu x64 (CPU)、Ubuntu arm64 (CPU)、Ubuntu s390x (CPU)、Ubuntu x64 (Vulkan)、Ubuntu arm64 (Vulkan)、Ubuntu x64 (CUDA 12,对应CUDA 12.8库)、Ubuntu x64 (CUDA 13,对应CUDA 13.4库)、Ubuntu arm64 (CUDA 13,对应CUDA 13.4库)、Ubuntu x64 (ROCm 10.0)、Ubuntu x64 (OpenVINO)、Ubuntu x64 (SYCL FP32)、Ubuntu x64 (SYCL FP16),以及Linux arm64 (Snapdragon: CPU、Adreno GPU、Hexagon NPU),后者附有设置指南。
Android方面:Android arm64 (CPU)、Android arm64 (Snapdragon: CPU、Adreno GPU、Hexagon NPU),同样附设置指南。Windows方面:Windows x64 (CPU)、Windows arm64 (CPU)、Windows arm64 (OpenCL Adreno)、Windows x64 (CUDA 12,对应CUDA 12.4 DLL)、Windows x64 (CUDA 13,对应CUDA 13.4 DLL)、Windows arm64 (CUDA 13,对应CUDA 13.4 DLL)、Windows x64 (Vulkan)、Windows x64 (OpenVINO)、Windows x64 (SYCL)、Windows x64 (ROCm 10.0)。
此外还有openEuler条目,整体标注为DISABLED并指向PR #23705,列出的组合为openEuler x86 (310p)、openEuler x86 (910b, ACL Graph)、openEuler aarch64 (310p)、openEuler aarch64 (910b, ACL Graph)。发布页还单列了UI包。