开源llama.cpp Releases·原文 2026年10月4日

llama.cpp发布b11387:修复截断后n-gram草稿在temp>0 被拒的问题

该版本由Pranesh Gonegandla共同提交,提交信息为“spec:修复截断后n-gram草稿在temp>0 时被拒(#29924)”,并随版本提供多平台预编译包。

AI解读:提交信息由Pranesh Gonegandla共同署名,来源为项目发布的版本说明,未包含该修复的测试数据或性能对比。

同一版本附带多平台预编译包,覆盖macOS/iOS、Linux、Android、Windows,以及Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL、Snapdragon等后端。

其中macOS Apple Silicon(arm64,KleidiAI enabled)与openEuler构建标注为DISABLED。

这批包适用于下载对应平台的二进制或iOS XCFramework的用户;来源未说明修复对具体推理速度或草稿接受率的影响。

llama.cpp项目发布b11387版本,变更记录中的唯一一条提交说明为“spec:修复截断后n-gram草稿在temp > 0 时被拒(#29924)”。该提交由Pranesh Gonegandla共同署名。

本次修复的内容

版本说明列出的变更只有这一项,提交编号为 #29924,提交信息为“spec : fix n-gram drafts rejected at temp > 0 after truncation”。“spec”指草稿推测(speculative)相关实现;来源未展开说明截断逻辑或温度判定的具体改动细节。

随版本提供的构建产物

b11387同时提供各平台预编译包,覆盖macOS/iOS、Linux、Android、Windows。Linux下包含CPU(x64、arm64、s390x)、Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL FP32/FP16,以及面向Snapdragon的CPU、Adreno GPU、Hexagon NPU构建;Windows下包含CPU(x64、arm64)、OpenCL Adreno、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0;Android下包含arm64 CPU与Snapdragon版;另有iOS XCFramework与UI包。

  • macOS Apple Silicon(arm64,KleidiAI enabled)标注为DISABLED,并指向PR #23780。
  • openEuler构建整体标注为DISABLED,并指向PR #23705,列表中列出x86 310p、x86 910b(ACL Graph)、aarch64 310p、aarch64 910b(ACL Graph)四项。
  • Snapdragon的Linux与Android构建分别附带setup guide文档链接。

适用范围与已知边界

修复作用于温度大于 0 时的n-gram草稿推测路径,来源只给出该条件描述,没有说明受影响的具体模型、采样参数组合或触发问题的复现步骤。版本说明未提供性能数据、通过率变化或对生成质量的评测结果,因此无法从该来源判断修复带来多大程度的加速或行为差异。

信息来源

llama.cpp Releases原始来源