llama.cpp发布b11387:修复截断后n-gram草稿在temp>0 被拒的问题
该版本由Pranesh Gonegandla共同提交,提交信息为“spec:修复截断后n-gram草稿在temp>0 时被拒(#29924)”,并随版本提供多平台预编译包。
AI解读:提交信息由Pranesh Gonegandla共同署名,来源为项目发布的版本说明,未包含该修复的测试数据或性能对比。
同一版本附带多平台预编译包,覆盖macOS/iOS、Linux、Android、Windows,以及Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL、Snapdragon等后端。
其中macOS Apple Silicon(arm64,KleidiAI enabled)与openEuler构建标注为DISABLED。
这批包适用于下载对应平台的二进制或iOS XCFramework的用户;来源未说明修复对具体推理速度或草稿接受率的影响。
llama.cpp项目发布b11387版本,变更记录中的唯一一条提交说明为“spec:修复截断后n-gram草稿在temp > 0 时被拒(#29924)”。该提交由Pranesh Gonegandla共同署名。
本次修复的内容
版本说明列出的变更只有这一项,提交编号为 #29924,提交信息为“spec : fix n-gram drafts rejected at temp > 0 after truncation”。“spec”指草稿推测(speculative)相关实现;来源未展开说明截断逻辑或温度判定的具体改动细节。
随版本提供的构建产物
b11387同时提供各平台预编译包,覆盖macOS/iOS、Linux、Android、Windows。Linux下包含CPU(x64、arm64、s390x)、Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO、SYCL FP32/FP16,以及面向Snapdragon的CPU、Adreno GPU、Hexagon NPU构建;Windows下包含CPU(x64、arm64)、OpenCL Adreno、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0;Android下包含arm64 CPU与Snapdragon版;另有iOS XCFramework与UI包。
- macOS Apple Silicon(arm64,KleidiAI enabled)标注为DISABLED,并指向PR #23780。
- openEuler构建整体标注为DISABLED,并指向PR #23705,列表中列出x86 310p、x86 910b(ACL Graph)、aarch64 310p、aarch64 910b(ACL Graph)四项。
- Snapdragon的Linux与Android构建分别附带setup guide文档链接。
适用范围与已知边界
修复作用于温度大于 0 时的n-gram草稿推测路径,来源只给出该条件描述,没有说明受影响的具体模型、采样参数组合或触发问题的复现步骤。版本说明未提供性能数据、通过率变化或对生成质量的评测结果,因此无法从该来源判断修复带来多大程度的加速或行为差异。