llama.cpp b10999发布:统一KV缓存下调整自动适配的最大上下文长度
llama.cpp发布b10999版本,唯一列出的变更是为统一KV缓存调整自动适配的最大上下文长度(PR #28849),同时提供macOS、Linux、Windows、Android等多平台预编译包。
AI解读:llama.cpp的b10999版本把改动集中在自动适配(auto-fitting)的最大上下文长度上,并且这一改动与统一KV缓存(unified KV)绑定。来源只给出这一条变更标题和对应的PR #28849,没有说明具体数值或行为差异。
对本地跑模型的人来说,自动适配关乎显存和内存怎么分。之前是按老KV缓存的占用模型去猜多大上下文能塞下,现在统一KV改了口径,这个上限也得跟着改,否则会出现估错导致加载失败或浪费空间的情况。
这次发布同时打包了macOS、iOS、Linux、Windows、Android的预编译二进制,覆盖CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL等后端。需要新版本的人可以直接下对应平台的压缩包,不用自己编译。
注意来源只有变更标题和下载列表,没有给出具体上下文长度数值、性能数据或兼容性说明。如果你的使用场景依赖自动适配的具体行为,需要自己到PR #28849 里核对细节。
llama.cpp发布b10999版本,发布说明中列出的唯一变更是“为统一KV缓存调整自动适配的最大上下文长度”,对应PR #28849。
该版本同时提供了覆盖macOS、iOS、Linux、Android、Windows以及openEuler的预编译二进制包。
唯一列出的变更:统一KV缓存下的自动适配上下文长度
发布说明的标题为“Change max context length for auto-fitting with unified KV (#28849)”,即调整在使用统一KV缓存(unified KV)时、自动适配(auto-fitting)所允许的最大上下文长度。
来源没有给出调整后的具体数值,也没有说明旧上限是多少、新上限是多少,因此无法从发布说明判断这一改动对显存占用或可加载上下文长度的实际影响。需要细节应查看PR #28849。
- 变更内容:为统一KV缓存调整自动适配的最大上下文长度
- 对应PR编号:#28849
- 发布说明未列出其他代码变更
本次提供的预编译平台与后端
b10999附带了大量预编译产物,覆盖桌面、移动和服务端平台。macOS方面提供Apple Silicon(arm64)与Intel(x64)二进制,以及iOS的XCFramework;其中macOS Apple Silicon的KleidiAI版本被标注为DISABLED,指向PR #23780。
Linux方面提供Ubuntu x64、arm64、s390x的CPU包,以及Vulkan、CUDA 12.8、CUDA 13.3、ROCm 10.0、OpenVINO 2026.3.1、SYCL FP32和SYCL FP16等后端包,另有对应的CUDA运行时库。
Windows方面提供x64与arm64的CPU包,arm64的OpenCL Adreno包,以及CUDA 12.4、CUDA 13.4(x64与arm64)、Vulkan、OpenVINO 2026.3.1、SYCL、ROCm 10.0等后端包及对应CUDA DLL。Android提供arm64 CPU包。openEuler相关构建被标注为DISABLED,指向PR #23705。此外还提供UI压缩包。
- macOS/iOS:Apple Silicon arm64、Intel x64、iOS XCFramework
- Linux:Ubuntu x64/arm64/s390x CPU,Vulkan、CUDA 12.8、CUDA 13.3、ROCm 10.0、OpenVINO、SYCL FP32/FP16
- Windows:x64/arm64 CPU,OpenCL Adreno arm64,CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0
- Android:arm64 CPU
- openEuler:已标注为DISABLED
- 另有UI包