llama.cpp发布b11065:为Ampere及更新架构显卡调优Gemma 4的FA
这是一次按版本号发布的常规构建,唯一代码变更是在CUDA后端为Gemma 4调整Flash Attention参数,并限定Ampere或更新的NVIDIA显卡。
llama.cpp发布了版本b11065。发布说明中列出的唯一代码变更是一条CUDA改动:为Gemma 4调优Flash Attention,适用架构限定为Ampere或更新(PR #29152)。
发布说明没有给出该调优的具体性能数字,也没有说明涉及哪些具体硬件型号或测试条件,只标明这是一次针对特定模型与特定架构的参数调整。
b11065随包发布了哪些平台
与llama.cpp其他构建一样,b11065在发布页提供各平台预编译产物。macOS/iOS方面提供Apple Silicon arm64、Intel x64以及iOS XCFramework;发布说明中标注Apple Silicon的KleidiAI版本处于DISABLED状态,并链到PR #23780。
Linux侧覆盖Ubuntu x64、arm64、s390x的CPU构建,以及Vulkan、CUDA 12(配CUDA 12.8运行时库)、CUDA 13(配CUDA 13.3运行时库,含arm64)、ROCm 10.0、OpenVINO 2026.4和SYCL FP32/FP16等构建。Windows侧提供x64、arm64的CPU构建,arm64的OpenCL Adreno构建,以及CUDA 12(12.4 DLL)、CUDA 13(13.4 DLL)、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0等构建。此外还有Android arm64 CPU构建和独立的UI包。
发布说明中,openEuler相关构建全部标记为DISABLED,并链接到PR #23705,原本的条目包括openEuler x86的 310p、x86的 910b(ACL Graph)、aarch64的 310p,以及aarch64的 910b(ACL Graph)。
- CUDA 12与CUDA 13的运行时库单独打包提供,Windows与Linux均是如此。
- macOS Apple Silicon的KleidiAI版本在本次发布中标记为DISABLED。
- openEuler的多个构建在本次发布中同样标记为DISABLED。
- 发布说明的作者标记为github-actions[bot]。