llama.cpp发布b11075:简化Metal融合算子列表声明
llama.cpp新构建b11075的改动集中在ggml-metal后端:从ops_all推导非空融合算子列表,并去掉融合算子模式向量名的 _all后缀;同时发布覆盖macOS、Linux、Windows、Android等平台的预编译包。
AI解读:这条发布没有新模型,也没有性能数字,改的是一个给GPU用的“算子名单”怎么声明。ggml-metal后端原先要把哪些算子能融合写两遍:一份全量列表,一份去掉空项后的实际列表。b11075改成从ops_all推导出非空的那份,少维护一个容易对不上的副本。
对直接用预编译包的Apple用户,这次变化体现在下载的文件上:macOS Apple Silicon的arm64 tar.gz、macOS Intel的x64 tar.gz和iOS XCFramework都已更新到b11075。Apple Silicon的KleidiAI版本标记为DISABLED,链接指向PR 23780,说明该构建当前不可用。
Linux和Windows侧的平台矩阵没有收缩。Linux覆盖Ubuntu x64/arm64/s390x的CPU包,以及Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16等后端;Windows覆盖CPU、OpenCL Adreno、CUDA 12.4/13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0。
openEuler相关构建同样标注为DISABLED,指向PR 23705。Android只提供一个arm64 CPU包,UI单独打包为tar.gz。需要自己编译而不是下载包的用户,这次唯一要关注的是Metal算子融合声明方式变了,源码级改动不影响已有模型文件的格式。
llama.cpp发布构建版本b11075,主要代码改动是简化ggml-metal后端的融合算子模式列表声明。
改动由两个提交组成:一是从ops_all推导出非空的融合算子列表,二是在融合算子模式向量中去掉 _all后缀,提交标注Assisted-by: pi:llama.cpp/DeepSeek-V4-Flash-Vision-Exp。
该版本同时提供macOS、iOS、Linux、Windows、Android与UI的预编译产物下载。
Metal后端改动具体做了什么
b11075的改动集中在ggml-metal,主题是简化融合模式(fusion pattern)算子列表的声明方式。
第一处改动是从ops_all推导出非空的融合算子列表,避免在源码中另外维护一份去掉空项后的列表;第二处改动是去掉融合算子模式向量名称中的 _all后缀。
两次提交的说明中均标注Assisted-by: pi:llama.cpp/DeepSeek-V4-Flash-Vision-Exp。发布说明未给出这一改动带来的性能或正确性影响数据。
各平台预编译包与不可用项
发布页按平台列出预编译包。macOS与iOS侧包括macOS Apple Silicon(arm64)、macOS Intel(x64)与iOS XCFramework;其中macOS Apple Silicon的KleidiAI enabled版本标注为DISABLED,并链接到PR 23780。
Linux侧提供Ubuntu x64与arm64的CPU包、Ubuntu s390x CPU包,以及Ubuntu x64/arm64的Vulkan包;x64另有CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO 2026.4与SYCL FP32/FP16构建,CUDA 12.8和CUDA 13.4各自附带对应的cudart运行库包。
Windows侧提供x64与arm64 CPU包、arm64 OpenCL Adreno包,以及x64的CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0构建;CUDA 12.4与CUDA 13.4附带DLL包,CUDA 13.4另有arm64版本。
Android只提供一个arm64 CPU包。openEuler的多个构建(x86 310p、x86 910b ACL Graph、aarch64 310p、aarch64 910b ACL Graph)标注为DISABLED,并链接到PR 23705。UI以单独的tar.gz提供。