llama.cpp发布b11316:Metal后端mxfp4矩阵乘法改用bf16计算
llama.cpp新版本b11316由GitHub Actions机器人发布,核心变更为Metal后端在mxfp4矩阵乘法中使用bf16数学,同时附带macOS、Linux、Windows、Android等多平台预编译包。
llama.cpp发布b11316版本,发布说明中唯一的功能变更描述是:Metal后端在mxfp4矩阵乘法(mul-mat)中改用bf16数学。该提交对应PR #29770。
该版本由GitHub Actions机器人发布,发布页主体是各平台预编译包的下载链接,未提供性能或精度数据,也未说明此次改动对推理速度或输出质量的具体影响。
唯一功能变更:Metal上mxfp4矩阵乘法使用bf16
发布说明标题为「metal : use bf16 math for mxfp4 mul-mat (#29770)」,即Metal后端的mxfp4矩阵乘法改用bf16数学。mxfp4是 4 位浮点权重格式,bf16是 16 位脑浮点格式,改动含义是乘法计算阶段提升数值精度。
发布说明没有给出这项改动带来的吞吐量、延迟或精度变化数据,也没有说明它对哪些模型或量化类型生效。PR编号 #29770 是发布说明中唯一保留的代码仓库引用。
- 变更内容:Metal后端mxfp4矩阵乘法使用bf16数学
- 对应PR:#29770
- 发布说明未提供性能或精度数据
预编译包覆盖平台与禁用项
b11316的发布页列出了面向macOS、iOS、Linux、Android、Windows的预编译二进制包,涵盖CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL、OpenCL Adreno、Snapdragon(CPU、Adreno GPU、Hexagon NPU)等后端。
其中两处被明确标注为DISABLED:macOS Apple Silicon的KleidiAI启用版本,以及openEuler构建(openEuler x86 310p/910b ACL Graph、aarch64 310p/910b ACL Graph)。发布说明未说明禁用原因,仅指向相关PR链接。
- macOS Apple Silicon(arm64)KleidiAI启用版本:DISABLED,关联PR #23780
- openEuler全部构建:DISABLED,关联PR #23705
- macOS提供Intel x64包,iOS提供XCFramework
- Linux提供Ubuntu x64/arm64/s390x,及Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16等包
- Windows提供CPU、OpenCL Adreno、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0等包
- Android提供arm64 CPU与Snapdragon(CPU、Adreno GPU、Hexagon NPU)包