开源llama.cpp Releases·原文 2026年9月25日

llama.cpp b11180发布:RPC分配缓存键加入nb,并将结果下限设为ggml_nbytes

该版本的核心改动来自PR #29283,由Georgi Gerganov参与合著:在RPC的get_alloc_size缓存键中加入nb,并把返回值下限固定为ggml_nbytes。

AI解读:llama.cpp的b11180版本改了一处RPC分配逻辑:get_alloc_size的缓存键现在把nb也算进去,返回值不再低于ggml_nbytes这个下限。

问题出在缓存键不完整时,不同大小的分配可能命中同一条缓存,拿到偏小的尺寸。加入nb区分维度、再用ggml_nbytes兜底,是让实际分配量不会被低估。

这套逻辑只影响走RPC后端的分配路径,普通本地CPU或CUDA推理不受影响。用llama.cpp搭分布式或跨设备RPC推理的人会关心它。

llama.cpp发布b11180版本,包含一项RPC相关改动,对应PR #29283,由Georgi Gerganov参与合著。

改动内容有两处:在get_alloc_size的缓存键中加入nb;把get_alloc_size的结果下限设为ggml_nbytes。

提交说明还提到两处整理:移除一条冗余注释,并添加一条TODO。

b11180同时提供macOS/iOS、Linux、Android、Windows等平台的预编译产物,覆盖CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16等后端;macOS Apple Silicon的KleidiAI版本标注为DISABLED,openEuler构建同样标注为DISABLED。

信息来源

llama.cpp Releases原始来源