llama.cpp b11048发布:Metal后端新增qwen4exp的DSV4 HC算子支持
该版本为qwen4exp使用的两种DSV4 HC算子变体增加Metal支持:带逐元素sigmoid门的hc_pre和以identity mixing实现的hc_post(comb == nullptr)。
AI解读:这次发布的核心是Metal后端补上了qwen4exp用到的DSV4 HC算子。具体是两种变体:hc_pre带逐元素sigmoid门,hc_post在comb为空指针时走identity mixing。换句话说,此前Metal上跑不通或需要绕路的这两个算子,现在有了原生实现。
受影响的主要是在苹果设备上跑这类模型的开发者。Metal后端对应macOS和iOS,这份release里同时提供了macOS Apple Silicon(arm64)、macOS Intel(x64)和iOS XCFramework的构建产物,意味着这些平台可以直接用新二进制,而不必只等自编译。
需要注意的是,来源只说明新增了算子支持,没有给出性能数字、与其他后端的对比,也没有说明哪些模型或量化格式因此受益。KleidiAI版macOS构建和openEuler构建在该版本中标注为DISABLED,实际可用性以对应链接为准。
llama.cpp发布b11048版本。该版本的改动是metal后端支持qwen4exp使用的DSV4 HC算子。
据发布说明,新增支持两种算子变体:hc_pre带逐元素sigmoid门(gated variant),hc_post在comb == nullptr时以identity mixing实现。
发布说明标注该改动关联PR #29000,并列出Assisted-by: pi:llama.cpp/Qwen3.8-27B。
同一版本还附带面向多平台的预编译产物,包括macOS Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework、Ubuntu(x64/arm64/s390x,CPU及Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO、SYCL等变体)、Windows(x64/arm64,CPU、OpenCL Adreno、CUDA 12、CUDA 13、Vulkan、OpenVINO、SYCL、ROCm 10.0)、Android arm64(CPU)以及UI包。
新增算子的具体形态
发布说明写明,此次Metal支持针对qwen4exp所用的DSV4 HC新算子变体。
第一种是hc_pre,采用逐元素sigmoid门,即gated variant;第二种是hc_post,采用identity mixing,触发条件是comb == nullptr。
- hc_pre:per-element sigmoid gate(gated variant)
- hc_post:identity mixing,comb == nullptr
- 关联PR:#29000
- Assisted-by:pi:llama.cpp/Qwen3.8-27B
可用构建与禁用项
b11048提供了macOS、iOS、Linux、Windows、Android的预编译包,以及独立的UI包。
其中macOS Apple Silicon的KleidiAI enabled构建和openEuler构建在本次发布中标注为DISABLED,并分别指向PR #23780 与PR #23705。
- macOS/iOS:macOS Apple Silicon (arm64)、macOS Intel (x64)、iOS XCFramework
- Linux:Ubuntu x64/arm64/s390x(CPU)、Vulkan、CUDA 12.8、CUDA 13.3、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16
- Windows:CPU x64/arm64、OpenCL Adreno arm64、CUDA 12.4、CUDA 13.4(含arm64)、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0
- Android:arm64 (CPU)
- UI:单独的llama-b11048-ui.tar.gz
- 标注DISABLED:macOS Apple Silicon (arm64, KleidiAI enabled)、openEuler各构建