开源llama.cpp Releases·原文 2026年9月30日

llama.cpp b11259发布:推测解码在EOG处停止接收草稿token

llama.cpp构建版本b11259发布,改动为“common : stop accepting draft tokens at EOG”,并移除相关测试;发布页同时提供macOS、Linux、Windows、Android等多个后端与加速配置的预编译包。

AI解读:这条发布最实质的改动只有一处:推测解码时,遇到EOG(序列结束标记)就不再继续接收草稿token,同时移除了一项相关测试。改动编号 #29638。

推测解码是让一个小模型先“猜”出若干token,再由主模型批量验证,命中就一次输出多个token。如果草稿里混入了EOG之后的内容,容易出现输出越界或行为不一致,这次修改就是把这类情况卡在结束符处。

对使用llama.cpp跑本地推理、尤其开了draft model的人,这个修复直接关系到生成结果的正确性;对只跑普通单模型推理的用户,本次更新基本没有感知。

发布页还列出macOS、Linux、Windows、Android、openEuler的预编译包和CUDA、Vulkan、ROCm、SYCL、OpenVINO、Snapdragon等后端选项,但来源没有给出性能数据或更细的改动说明,具体影响需以仓库提交为准。

llama.cpp发布构建版本b11259,发布页标注的本次改动为“common : stop accepting draft tokens at EOG”(#29638),即推测解码过程中遇到EOG标记后停止接收草稿token。

信息来源

llama.cpp Releases原始来源