开源llama.cpp Releases·原文 2026年9月25日

llama.cpp发布b11169,修复token_id解析中的数值截断问题

llama.cpp新版本b11169的改动集中在llama-grammar模块,修复token_id解析时的数值截断,同时提供覆盖macOS、Linux、Windows、Android及多种加速后端的预编译包。

AI解读:llama.cpp的b11169版本主要修了一个底层小问题:llama-grammar在解析token_id时会出现数值截断,这可能让语法约束下的token编号对不上。官方发布说明把这条列为该版本的改动,并附上了对应的PR编号 #29382。

token_id是模型词表里的编号,解析出错意味着按语法规则约束输出时,可能引用到错误的token。普通聊天用户大概率感受不到,但依赖JSON模式、结构化输出或自定义语法的开发者会直接受影响。

b11169同时提供了大批预编译二进制包,覆盖macOS、iOS、Linux、Windows、Android和openEuler等平台,并包含CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL等后端,方便不想自己编译的用户直接下载。

这次发布没有附带性能数据或新的模型支持信息,来源仅是发布页的改动说明和下载清单,修复的实际效果还需要使用方在自己的语法场景里验证。

llama.cpp发布了b11169版本。根据发布页信息,该版本包含一项修复:llama-grammar修正token_id解析时的数值截断问题,对应PR #29382。

发布页同时列出了面向多个平台和加速后端的预编译二进制包,包括macOS/iOS、Linux、Windows、Android以及openEuler等条目,部分后端标注为DISABLED或未提供下载。

llama-grammar修复token_id解析截断

b11169的改动说明只有一条:llama-grammar修复token_id解析中的数值截断,PR编号 #29382。发布页未展开该bug的触发条件、影响范围或验证方式。

llama-grammar是llama.cpp中负责语法约束输出的模块,token_id是模型词表内的token编号。解析时发生数值截断,可能导致语法约束引用到错误的token;具体行为在来源中没有进一步说明。

  • 改动标题:llama-grammar: fix numeric truncation for token_id parsing
  • 对应PR:#29382
  • 发布页未提供性能对比或回归测试结果

预编译包覆盖范围

发布页按平台列出可下载的构建产物。macOS Apple Silicon提供arm64包,Apple Silicon的KleidiAI启用版本标注为DISABLED;macOS Intel提供x64包,iOS提供XCFramework。Linux方面覆盖Ubuntu x64、arm64、s390x的CPU包,以及Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL FP32/FP16等后端;另有Linux arm64面向Snapdragon的CPU、Adreno GPU、Hexagon NPU包。

Windows提供x64与arm64的CPU包、Windows arm64的OpenCL Adreno包,以及CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0等构建;Android提供arm64 CPU包和Snapdragon的CPU/Adreno GPU/Hexagon NPU包;openEuler的相关条目标注为DISABLED。此外还提供UI压缩包。

  • macOS/iOS:Apple Silicon arm64、macOS Intel x64、iOS XCFramework
  • Linux:Ubuntu x64/arm64/s390x CPU,Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL
  • Windows:x64/arm64 CPU,CUDA 12.4/13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0
  • Android:arm64 CPU,Snapdragon的CPU、Adreno GPU、Hexagon NPU
  • openEuler条目标注DISABLED
  • 另有UI包

信息来源

llama.cpp Releases原始来源