llama.cpp b11236发布:推测解码、mtmd与server迁移到batch_ext
该版本把推测解码、多模态(mtmd)和服务器三条路径统一迁到batch_ext,并新增common_batch、修正add()/add_embd() 返回值处理、为零填充路径加警告。
llama.cpp发布b11236版本。提交说明显示,这次改动把推测解码(speculative)、多模态(mtmd)和server三条路径迁移到batch_ext,并新增common_batch,server_batch改为使用common_batch,同时删除了一些过期调用。
迁移覆盖推测解码、mtmd和server
提交信息把改动概括为“batch: migrate speculative, mtmd and server to batch_ext (#29385)”。具体步骤包括:适配common、新增common_batch、迁移spec到common_speculative_process、让server_batch使用common_batch、删除一些过期调用,以及迁移mtmd。
提交信息还注明处理了imrope,并处理了add()/add_embd() 的返回值。提交中新增了spec的零向量(zeros vector),并在零填充路径上添加了警告。
- 迁移范围:speculative、mtmd、server
- 新增common_batch,server_batch改用common_batch
- 新增spec零向量,零填充路径加警告
- 提交注明Assisted-by: Claude Fable 5.1
平台产物与已知禁用项
发布页列出了各平台预编译产物,覆盖macOS/iOS、Linux、Android、Windows和openEuler。macOS部分包含Apple Silicon(arm64)与Intel(x64)二进制以及iOS XCFramework;Linux部分包含Ubuntu x64、arm64、s390x的CPU版本,以及Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL FP32/FP16等版本,另有Snapdragon(CPU、Adreno GPU、Hexagon NPU)的arm64包。
- Windows侧包含CPU、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0等版本
- Android包含arm64 CPU与Snapdragon(CPU、Adreno GPU、Hexagon NPU)版本
- macOS Apple Silicon的KleidiAI启用版本标注为DISABLED,关联PR #23780
- openEuler条目整体标注为DISABLED,关联PR #23705