开源llama.cpp Releases·原文 2026年10月2日

llama.cpp b11334发布:Metal后端释放临时私有传输缓冲区

该版本的主要改动是在Metal后端释放临时私有传输缓冲区,由Niklas Wenzel参与,OpenAI Codex协助。

AI解读:受影响的不是所有用户,而是用苹果芯片(Apple Silicon)Mac或iOS设备跑Metal后端的开发者。对这部分人来说,这次更新意味着后台内存管理更干净;对只跑CPU、CUDA、Vulkan的人,影响可以忽略。

不过来源只是发布页,没有给出内存下降百分比、复现场景或性能前后对比。因此现在还无法量化收益,只能确认改动的方向:把用完的临时缓冲区交还。

llama.cpp发布构建版本b11334,主要改动是让Metal后端释放临时的私有传输缓冲区(PR #29777)。

提交信息显示,这项改动由Niklas Wenzel共同参与,并注明有OpenAI Codex协助;PR主题为“metal : release temporary private transfer buffers”。

同一PR还包含“修正顺序和格式”的改动。来源为llama.cpp Releases页面,除提交说明和构建产物清单外,未提供更多技术细节。

b11334包含哪些构建产物

发布页列出了各平台的预编译包,覆盖macOS、iOS、Linux、Android和Windows。

macOS/iOS方面提供macOS Apple Silicon(arm64)、macOS Intel(x64)和iOS XCFramework;标注为“macOS Apple Silicon (arm64, KleidiAI enabled)”的版本处于DISABLED状态。

Linux方面提供Ubuntu x64、arm64、s390x的CPU包,以及Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO、SYCL FP32/FP16版本,还有Snapdragon(CPU、Adreno GPU、Hexagon NPU)的Linux arm64包。

Android提供arm64 CPU包和Snapdragon版本,Windows提供x64/arm64 CPU、OpenCL Adreno、CUDA 12、CUDA 13、Vulkan、OpenVINO、SYCL、ROCm 10.0等版本。openEuler系列构建处于DISABLED状态。

信息来源

llama.cpp Releases原始来源