开源llama.cpp Releases·原文 2026年9月29日

llama.cpp b11236发布:推测解码、mtmd与server迁移到batch_ext

该版本把推测解码、多模态(mtmd)和服务器三条路径统一迁到batch_ext,并新增common_batch、修正add()/add_embd() 返回值处理、为零填充路径加警告。

llama.cpp发布b11236版本。提交说明显示,这次改动把推测解码(speculative)、多模态(mtmd)和server三条路径迁移到batch_ext,并新增common_batch,server_batch改为使用common_batch,同时删除了一些过期调用。

迁移覆盖推测解码、mtmd和server

提交信息把改动概括为“batch: migrate speculative, mtmd and server to batch_ext (#29385)”。具体步骤包括:适配common、新增common_batch、迁移spec到common_speculative_process、让server_batch使用common_batch、删除一些过期调用,以及迁移mtmd。

提交信息还注明处理了imrope,并处理了add()/add_embd() 的返回值。提交中新增了spec的零向量(zeros vector),并在零填充路径上添加了警告。

  • 迁移范围:speculative、mtmd、server
  • 新增common_batch,server_batch改用common_batch
  • 新增spec零向量,零填充路径加警告
  • 提交注明Assisted-by: Claude Fable 5.1

平台产物与已知禁用项

发布页列出了各平台预编译产物,覆盖macOS/iOS、Linux、Android、Windows和openEuler。macOS部分包含Apple Silicon(arm64)与Intel(x64)二进制以及iOS XCFramework;Linux部分包含Ubuntu x64、arm64、s390x的CPU版本,以及Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL FP32/FP16等版本,另有Snapdragon(CPU、Adreno GPU、Hexagon NPU)的arm64包。

  • Windows侧包含CPU、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0等版本
  • Android包含arm64 CPU与Snapdragon(CPU、Adreno GPU、Hexagon NPU)版本
  • macOS Apple Silicon的KleidiAI启用版本标注为DISABLED,关联PR #23780
  • openEuler条目整体标注为DISABLED,关联PR #23705

信息来源

llama.cpp Releases原始来源