llama.cpp发布b11446:修复Metal量化Flash Attention线程组内存超额问题
llama.cpp新版本b11446包含一项Metal后端修复,针对量化Flash Attention中线程组内存超额的问题(PR #29340),同时照例提供macOS、Linux、Windows、Android等多平台预编译包。
AI解读:该版本提供macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework、Linux(Ubuntu x64/arm64/s390x及Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL变体)、Android arm64、Windows(CPU、CUDA、Vulkan、OpenVINO、SYCL、ROCm 10.0)等预编译包。
部分构建被标记为DISABLED:macOS Apple Silicon的KleidiAI启用版本(PR #23780)与openEuler相关构建(PR #23705)。
发布说明仅包含变更标题、下载链接与构建列表,未给出性能数据、受影响模型范围或修复前后的对比测试结果。
llama.cpp项目发布b11446版本,发布说明列出的唯一变更是Metal后端修复:解决量化Flash Attention中线程组内存(threadgroup memory)超额使用的问题,对应PR #29340。
该版本同时照例提供多平台预编译二进制包,覆盖macOS、iOS、Linux、Android、Windows及UI组件。
本次变更:Metal量化Flash Attention内存修复
发布说明以“metal : fix excess threadgroup memory in quantized flash attention (#29340)”作为本次版本标题,表明改动位于Metal后端,针对量化场景下的Flash Attention实现,修复线程组内存超额的问题。
发布说明未附具体测试数据、受影响模型列表或性能对比,因此修复的实际效果范围无法从该来源确认。
- 变更标题:metal : fix excess threadgroup memory in quantized flash attention
- 对应PR:#29340
- 未提供性能数据或对比测试结果
可用构建与禁用项
b11446按惯例提供多条构建产物,覆盖Apple平台、Linux(含多种加速后端)、Android与Windows,并附带iOS XCFramework与UI压缩包。
发布说明中标注为DISABLED的构建包括:macOS Apple Silicon(arm64,KleidiAI启用,PR #23780)与openEuler相关构建(PR #23705)。
- macOS/iOS:Apple Silicon arm64、Intel x64、iOS XCFramework
- Linux:Ubuntu x64/arm64/s390x(CPU)、Vulkan、CUDA 12.8、CUDA 13.4(x64与arm64)、ROCm 10.0、OpenVINO、SYCL FP32/FP16、Snapdragon(CPU/Adreno GPU/Hexagon NPU)
- Android:arm64 CPU、arm64 Snapdragon(CPU/Adreno GPU/Hexagon NPU)
- Windows:x64/arm64 CPU、arm64 OpenCL Adreno、CUDA 12.4、CUDA 13.4(x64与arm64)、Vulkan、OpenVINO、SYCL、ROCm 10.0
- UI:llama-b11446-ui.tar.gz
- DISABLED:macOS Apple Silicon KleidiAI(PR #23780)、openEuler(PR #23705)