开源llama.cpp Releases·原文 2026年9月18日

llama.cpp发布b11036:ggml处理图缓冲区预留失败

llama.cpp新版本b11036的核心变更是ggml后端现在会处理图缓冲区预留失败(#26070),同时照例放出macOS、Linux、Windows、Android等多平台预编译包。

AI解读:这次发布真正改动的只有一处:ggml现在会处理图缓冲区预留失败(#26070)。这是个错误处理层面的修补,不是性能或模型能力更新。

对跑本地推理的人来说,意义在于显存或内存不够时,失败路径会被显式处理,而不是任由问题往下传。但它具体改成什么行为——报错、回退还是中止——发布说明没有展开,只看摘要无法判断。

其余内容基本是例行产物:macOS、iOS、Linux、Windows、Android各平台预编译包照常发出,OpenVINO、Vulkan、CUDA、SYCL等后端标签也在。有需要的人直接下对应包即可,其他人不必专门升级。

llama.cpp发布了b11036版本,发布说明中列出的代码变更为“ggml:处理图缓冲区预留失败”(#26070)。

b11036唯一的代码改动:ggml处理图缓冲区预留失败

发布说明把本版变更描述为“ggml : handle graph buffer reservation failure (#26070)”。除此之外,说明中没有列出其他代码改动。

该条目对应到ggml的图缓冲区预留环节,即预留失败时的处理路径。发布说明未说明失败后的具体行为、触发条件或影响范围。

  • 变更描述:ggml : handle graph buffer reservation failure (#26070)。
  • 发布说明未给出更多技术细节或复现条件。

随版本发布的各平台预编译产物

b11036照例提供多平台预编译二进制与库。发布说明按平台分组列出了下载项。

macOS/iOS方向提供macOS Apple Silicon(arm64)、macOS Intel(x64)和iOS XCFramework;其中macOS Apple Silicon的KleidiAI启用版本被标注为DISABLED,并指向PR #23780。

Linux方向覆盖Ubuntu x64/arm64/s390x(CPU)、Ubuntu x64与arm64(Vulkan)、Ubuntu x64(CUDA 12,对应CUDA 12.8)、Ubuntu x64与arm64(CUDA 13,对应CUDA 13.3)、Ubuntu x64(ROCm 10.0)、Ubuntu x64(OpenVINO 2026.4)以及Ubuntu x64的SYCL FP32与FP16。

Windows方向覆盖x64/arm64(CPU)、arm64(OpenCL Adreno)、x64与arm64(CUDA 13,对应CUDA 13.4)、x64(CUDA 12,对应CUDA 12.4)、x64(Vulkan)、x64(OpenVINO 2026.4)、x64(SYCL)和x64(ROCm 10.0)。

Android方向提供arm64(CPU)包;另有独立的UI包。openEuler相关条目在该版本中标注为DISABLED,并指向PR #23705。

  • macOS/iOS:macOS Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework;KleidiAI启用版本DISABLED(PR #23780)。
  • Linux:Ubuntu x64/arm64/s390x(CPU)、Vulkan、CUDA 12.8、CUDA 13.3、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16。
  • Windows:x64/arm64(CPU)、OpenCL Adreno arm64、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0。
  • Android:arm64(CPU);另有UI包。
  • openEuler条目为DISABLED(PR #23705)。

信息来源

llama.cpp Releases原始来源