开源llama.cpp Releases·原文 2026年9月19日

llama.cpp b11048发布:Metal后端新增qwen4exp的DSV4 HC算子支持

该版本为qwen4exp使用的两种DSV4 HC算子变体增加Metal支持:带逐元素sigmoid门的hc_pre和以identity mixing实现的hc_post(comb == nullptr)。

AI解读:这次发布的核心是Metal后端补上了qwen4exp用到的DSV4 HC算子。具体是两种变体:hc_pre带逐元素sigmoid门,hc_post在comb为空指针时走identity mixing。换句话说,此前Metal上跑不通或需要绕路的这两个算子,现在有了原生实现。

受影响的主要是在苹果设备上跑这类模型的开发者。Metal后端对应macOS和iOS,这份release里同时提供了macOS Apple Silicon(arm64)、macOS Intel(x64)和iOS XCFramework的构建产物,意味着这些平台可以直接用新二进制,而不必只等自编译。

需要注意的是,来源只说明新增了算子支持,没有给出性能数字、与其他后端的对比,也没有说明哪些模型或量化格式因此受益。KleidiAI版macOS构建和openEuler构建在该版本中标注为DISABLED,实际可用性以对应链接为准。

llama.cpp发布b11048版本。该版本的改动是metal后端支持qwen4exp使用的DSV4 HC算子。

据发布说明,新增支持两种算子变体:hc_pre带逐元素sigmoid门(gated variant),hc_post在comb == nullptr时以identity mixing实现。

发布说明标注该改动关联PR #29000,并列出Assisted-by: pi:llama.cpp/Qwen3.8-27B。

同一版本还附带面向多平台的预编译产物,包括macOS Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework、Ubuntu(x64/arm64/s390x,CPU及Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO、SYCL等变体)、Windows(x64/arm64,CPU、OpenCL Adreno、CUDA 12、CUDA 13、Vulkan、OpenVINO、SYCL、ROCm 10.0)、Android arm64(CPU)以及UI包。

新增算子的具体形态

发布说明写明,此次Metal支持针对qwen4exp所用的DSV4 HC新算子变体。

第一种是hc_pre,采用逐元素sigmoid门,即gated variant;第二种是hc_post,采用identity mixing,触发条件是comb == nullptr。

  • hc_pre:per-element sigmoid gate(gated variant)
  • hc_post:identity mixing,comb == nullptr
  • 关联PR:#29000
  • Assisted-by:pi:llama.cpp/Qwen3.8-27B

可用构建与禁用项

b11048提供了macOS、iOS、Linux、Windows、Android的预编译包,以及独立的UI包。

其中macOS Apple Silicon的KleidiAI enabled构建和openEuler构建在本次发布中标注为DISABLED,并分别指向PR #23780 与PR #23705。

  • macOS/iOS:macOS Apple Silicon (arm64)、macOS Intel (x64)、iOS XCFramework
  • Linux:Ubuntu x64/arm64/s390x(CPU)、Vulkan、CUDA 12.8、CUDA 13.3、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16
  • Windows:CPU x64/arm64、OpenCL Adreno arm64、CUDA 12.4、CUDA 13.4(含arm64)、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0
  • Android:arm64 (CPU)
  • UI:单独的llama-b11048-ui.tar.gz
  • 标注DISABLED:macOS Apple Silicon (arm64, KleidiAI enabled)、openEuler各构建

信息来源

llama.cpp Releases原始来源