开源llama.cpp Releases·原文 2026年9月10日本站收录 2026年9月11日

llama.cpp b10889发布:索引器不再分配V缓存

该版本唯一列出的改动是内存优化——为索引器(indexer)避免分配未被使用的V cache,由Stanisław Szymczyk参与提交(#28330)。

AI解读:llama.cpp发布b10889版本,这次改动很单一:内存层面避免为indexer分配V cache,理由是这块缓存并没有被用到。

indexer在推理里负责选位置,V cache存的是注意力的value张量;既然用不上,占着显存/内存就纯属浪费。此次修改针对的就是这笔无效占用。

影响面主要在本地跑大模型的人:省下的量取决于模型和上下文规模,能腾出多少资源需要实测,不要把它当成一次吞吐升级。

llama.cpp发布b10889版本,唯一列出的代码改动来自PR #28330:memory层面避免为indexer分配V cache,原因是它并未被使用。该提交由Stanisław Szymczyk参与(Co-authored-by)。

改动内容与构建产物范围

该提交的标题为“memory : avoid allocating V cache for indexer (it's not used) (#28330)”。来源未提供该改动带来的内存节省数字、性能对比数据或具体受影响的模型类型。

随版本一同发布的是各平台预编译产物:macOS Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework;Ubuntu x64/arm64(CPU)、Ubuntu s390x(CPU)、Ubuntu x64/arm64(Vulkan)、Ubuntu x64(ROCm 10.0)、Ubuntu x64(OpenVINO 2026.3.1)、Ubuntu x64(SYCL FP32/FP16);Android arm64(CPU);Windows x64(CPU)、Windows arm64(CPU)、Windows arm64(OpenCL Adreno)、Windows x64(CUDA 12.4与CUDA 13.3,含对应DLL)、Windows arm64(CUDA 13.4,preview,含DLL)、Windows x64(Vulkan)、Windows x64(OpenVINO 2026.3.1)、Windows x64(SYCL)、Windows x64(ROCm 10.0);以及独立的UI包。

  • macOS Apple Silicon(arm64)版标注为DISABLED;macOS Apple Silicon(arm64, KleidiAI enabled)同样标注DISABLED。
  • openEuler相关产物(x86 310p、x86 910b ACL Graph、aarch64 310p、aarch64 910b ACL Graph)均标注为DISABLED。

信息来源

llama.cpp Releases原始来源