开源llama.cpp Releases·原文 2026年9月30日

llama.cpp发布b11261:ggml要求输入张量必须为GGML_OP_NONE

llama.cpp构建b11261将ggml的一项约束合并进主干:输入张量必须是GGML_OP_NONE,对应PR #29647;发布页同时提供各平台预编译包。

AI解读:对普通下载预编译包跑模型的用户,这条改动大概率不需要额外操作;真正要留意的是自己拼张量图、写自定义算子或改ggml后端的开发者,输入张量类型不再随便,得符合这一要求。发布页没有给出性能或效果数据,所以能说的只是约束本身。

同一发布页照例列出macOS、Linux、Windows、Android等平台的预编译文件,包括CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL等后端。其中macOS Apple Silicon的KleidiAI版本和openEuler相关构建在发布页标注为DISABLED。来源是GitHub Releases的发布页,不是逐条commit说明,因此除标题改动外没有更多实现细节。

llama.cpp发布b11261构建。发布页标题给出的变更是:ggml要求输入张量必须为GGML_OP_NONE,对应合并请求 #29647。

该版本随发布页提供多平台预编译包,包括macOS/iOS、Linux、Android和Windows。macOS Apple Silicon(arm64)的KleidiAI启用版本被标注为DISABLED,并链接到PR #23780;openEuler相关构建同样标注为DISABLED,链接到PR #23705。

b11261的变更与预编译产物

llama.cpp发布的b11261是一个新的构建版本,发布页标题写明改动为“ggml : require input tensors to be GGML_OP_NONE (#29647)”,即ggml要求输入张量必须是GGML_OP_NONE。发布方为ggml-org/llama.cpp,发布记录由github-actions[bot] 提交。

发布页按平台列出可下载的二进制包。macOS/iOS部分包含macOS Apple Silicon(arm64)、macOS Apple Silicon(arm64,启用KleidiAI,但标注DISABLED)、macOS Intel(x64)以及iOS XCFramework。Linux部分覆盖Ubuntu x64/arm64/s390x的CPU构建,以及Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16等后端;另有Linux arm64的Snapdragon包,包含CPU、Adreno GPU和Hexagon NPU。

Android部分提供arm64的CPU包和Snapdragon(CPU、Adreno GPU、Hexagon NPU)包,并附有设置指南链接。Windows部分提供x64/arm64的CPU包、arm64的OpenCL Adreno包、CUDA 12.4、CUDA 13.4(x64与arm64)、Vulkan、OpenVINO 2026.4、SYCL以及ROCm 10.0等构建。UI包也单独提供。openEuler相关条目显示为DISABLED状态。

  • 变更:ggml要求输入张量必须为GGML_OP_NONE,PR #29647。
  • 平台包:macOS Apple Silicon/Intel、iOS XCFramework、Ubuntu x64/arm64/s390x、Linux arm64 Snapdragon、Android arm64、Windows x64/arm64、UI。
  • 后端包:Vulkan、CUDA 12.8/13.4/12.4、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16、OpenCL Adreno。
  • 标注DISABLED:macOS Apple Silicon(KleidiAI启用版,PR #23780)、openEuler(PR #23705)。

信息来源

llama.cpp Releases原始来源