开源llama.cpp Releases·原文 2026年10月2日

llama.cpp b11330发布:为Qwen4Exp加入MTP支持

llama.cpp新构建版本b11330的改动是为Qwen4Exp添加MTP,同时清理了循环内存相关代码;发布页主要提供各平台预编译包下载。

AI解读:这条新闻的核心是llama.cpp在版本b11330里给Qwen4Exp加上了MTP支持。MTP通常指多token预测,目标是让一次前向计算不只输出一个token,从而摊薄推理开销、加快生成速度。

改动不止新增功能:提交记录显示还移除了has_state成员,改为通过ctx_bufs是否为空来判断状态,并顺带清理了循环内存相关代码和注释,作者署名里包含Georgi Gerganov。

对直接用llama.cpp跑Qwen4Exp的人来说,这是能力边界的一次扩展;但对不碰这个模型的人,本次发布主要是常规构建和预编译包更新,不需要立即行动。MTP的实际加速幅度在发布说明里没有给出数据。

llama.cpp发布新构建版本b11330,GitHub发布说明中列出的核心改动是为Qwen4Exp添加MTP支持。

同一提交还涉及代码清理:移除has_state成员,改为通过ctx_bufs是否非空来检查状态,并精简注释、清理循环内存相关实现。提交记录中列出的共同作者包括Georgi Gerganov。

发布页同时提供各平台的预编译二进制文件,覆盖macOS、iOS、Linux、Android、Windows以及UI构建。发布说明中没有给出MTP的加速数据或性能对比。

b11330里改了什么

发布说明的标题为“Qwen4Exp: add MTP (#29761)”,对应的改动是给Qwen4Exp加入MTP。提交记录中的具体条目包括:移除has_state成员,改为检查ctx_bufs是否非空;统一命名并精简注释;继续清理循环内存相关实现。

  • 新增内容:Qwen4Exp的MTP支持
  • 状态判断方式调整:移除has_state,改用ctx_bufs是否非空
  • 代码整理:精简注释、统一命名、清理循环内存
  • 共同作者中出现Georgi Gerganov

发布包覆盖的平台

本次发布附带的构建产物覆盖多个平台。macOS/iOS方面包括Apple Silicon(arm64)和Intel(x64)以及iOS XCFramework;其中macOS Apple Silicon的KleidiAI版本标注为DISABLED。

Linux方面提供Ubuntu x64/arm64/s390x的CPU构建,以及Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO、SYCL FP32/FP16等后端版本,另有面向骁龙平台的Linux arm64包,支持CPU、Adreno GPU和Hexagon NPU。

Android提供CPU版本和骁龙版本。Windows覆盖x64/arm64 CPU、OpenCL Adreno、CUDA 12、CUDA 13、Vulkan、OpenVINO、SYCL、ROCm 10.0等构建。openEuler相关构建标注为DISABLED。另有一个UI构建包。

信息来源

llama.cpp Releases原始来源