llama.cpp回滚统一KV的自动上下文长度调整改动
llama.cpp发布b11201版本,撤销了PR #28849 中修改统一KV自动适配最大上下文长度的提交,已构建的多平台二进制包同步更新。
AI解读:llama.cpp的b11201构建把一次关于“统一KV缓存自动适配时的最大上下文长度”的改动回滚了。被撤销的是PR #28849 引入的提交b04d4e5,回滚由PR #29437 完成。
这次回滚影响的是依赖自动适配统一KV缓存上下文的用户——他们之前观察到的行为变化会被撤回,恢复到改动之前的逻辑。对于手动指定上下文长度、或不用统一KV的人,这次变动基本没有感知。
变更只涉及这一个提交,不是大版本重构,但发布的二进制覆盖面很广,从macOS、iOS、多种Linux与Windows构建,到CUDA、Vulkan、ROCm、OpenVINO、SYCL等后端都有对应包,因此使用预编译包的人可以直接换用b11201。
llama.cpp发布b11201版本,其中包含一次回滚:撤销了PR #28849 中“Change max context length for auto-fitting with unified KV”的提交b04d4e567cd2fb8d2ded6e17d38dbbcfafe29063,回滚提交对应PR #29437。
发布说明来自llama.cpp Releases,由github-actions[bot] 发布,正文仅列出回滚标题与各平台构建产物下载链接,未附带更多技术细节或回滚原因说明。
b11201同步提供了覆盖多平台的预编译产物,包括macOS Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework,以及Ubuntu x64/arm64/s390x的CPU构建。
Ubuntu侧还提供Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL FP32与SYCL FP16构建,以及Snapdragon平台(CPU、Adreno GPU、Hexagon NPU)的Linux arm64包。
Windows提供CPU x64/arm64、OpenCL Adreno arm64、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0等构建;Android提供arm64 CPU与Snapdragon版本;另有独立的UI包。
发布说明中标注macOS Apple Silicon的KleidiAI启用版与openEuler相关构建处于DISABLED状态,并分别链接到对应的拉取请求。