开源llama.cpp Releases·原文 2026年9月11日

llama.cpp b10907修复deepseek2、glm4moe等架构的MTP上下文KV缓存分配

该版本为deepseek2、glm4moe、cohere2moe架构修复MTP上下文KV缓存分配问题,并加入逆架构门控;同时发布覆盖macOS、Linux、Windows、Android的多平台预编译包。

llama.cpp发布b10907版本,主要变更是修复MTP上下文KV缓存分配问题,涉及deepseek2、glm4moe、cohere2moe三种架构。对应PR为 #28630,其内部修复PR为 #28626。

该提交同时加入逆架构门控(inverse architecture gating)以及针对MTP层过滤的完整架构测试,并精简了NextN过滤相关注释,同时去掉了对test-llama-archs的改动。

发布说明显示,本次按平台提供了预编译二进制包,涵盖macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework、Linux(Ubuntu x64/arm64/s390x,含CPU、Vulkan、ROCm 10.0、OpenVINO、SYCL FP32/FP16等变体)、Android arm64、Windows(CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm 10.0等)以及UI包。

信息来源

llama.cpp Releases原始来源