开源llama.cpp Releases·原文 2026年9月29日

llama.cpp b11238用ggml_pad_ext统一左填充,并精简DFlash2读取

该版本把Parakeet、LFM2-Audio、Granite Speech、Gemma 4音频编码器和DFlash2原本手工拼出的左填充合并为一个ggml_pad_ext节点,并跳过只读取填充的DFlash2 tap。

AI解读:llama.cpp发布b11238,改动集中在模型计算图的填充方式:Parakeet、LFM2-Audio、Granite Speech、Gemma 4音频编码器和DFlash2不再自己拼左填充。

这些模型原来的做法是“先右填充、再滚动”,或者在已有token前面接一块零。现在这种情况交给ggml_pad_ext一个节点完成,前提是每个后端都已支持左填充。

对使用这些音频编码器的人来说,直接的保证是Gemma 4音频嵌入逐位相同,输出没有变化;DFlash2则多了一条跳过无效tap的优化,循环只跑min(kernel_size, block_size) 次。

这次更新随b11238二进制一同发布,覆盖macOS、iOS、Linux、Windows、Android以及CUDA、Vulkan、ROCm、SYCL、OpenVINO等后端;多数用户只是升级构建,模型行为不变。

llama.cpp发布b11238版本,提交说明显示改动集中在模型侧的左填充实现。

Parakeet、LFM2-Audio、Granite Speech和Gemma 4的音频编码器此前把左填充构造成“右填充加一次滚动”,DFlash2则在已有token前拼接一个零填充块。

提交说明称,现在每个后端都支持左填充,ggml_pad_ext可以在一个节点里同时完成这两种操作。

Gemma 4音频嵌入的结果与改动前逐位相同。

DFlash2方面,改动还跳过了只读取填充部分的tap:位于或超过block_size的tap会把每一行都移出该块,因此其项为零,循环只运行min(kernel_size, block_size) 个tap。

b11238同时发布了Website、macOS/iOS、Linux、Android、Windows、openEuler和UI的构建产物。

哪些模型换了填充实现

提交说明列出Parakeet、LFM2-Audio、Granite Speech、Gemma 4音频编码器以及DFlash2。

这些模型此前分别用“右填充后滚动”或“在前方拼接零填充块”的方式构造左填充,现在统一改为ggml_pad_ext一个节点。

说明中给出的前提是每个后端都已支持左填充;Gemma 4音频嵌入的输出保持逐位相同。

  • Parakeet、LFM2-Audio、Granite Speech、Gemma 4音频编码器:左填充由右填充加滚动改为ggml_pad_ext。
  • DFlash2:原本在已有token前拼接零填充块,现在由同一节点处理。
  • Gemma 4音频嵌入被明确标注为逐位相同。

DFlash2跳过只读填充的tap

同一提交还修改了DFlash2的循环。

说明指出,位于或超过block_size的tap会把每一行都移出该块,所以这一项为零;循环因此只运行min(kernel_size, block_size) 个tap。

b11238的发布产物

该版本随b11238标签发布,提交由github-actions[bot] 写出。

发布页面列出Website、macOS/iOS、Linux、Android、Windows、openEuler和UI的产物。

macOS提供Apple Silicon arm64和Intel x64构建;Linux提供Ubuntu x64、arm64、s390x,以及CPU、Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO、SYCL FP32、SYCL FP16、Snapdragon等构建;Windows提供x64和arm64的CPU、CUDA 12、CUDA 13、Vulkan、OpenVINO、SYCL、ROCm 10.0等构建;Android提供arm64和Snapdragon构建。

发布页还标注macOS Apple Silicon的KleidiAI构建以及openEuler构建为DISABLED。

  • 发布标签:b11238。
  • 产物范围:Website、macOS/iOS、Linux、Android、Windows、openEuler、UI。
  • Linux后端覆盖CPU、Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO、SYCL FP32/FP16、Snapdragon。
  • Windows后端覆盖CPU、CUDA 12、CUDA 13、Vulkan、OpenVINO、SYCL、ROCm 10.0。

信息来源

llama.cpp Releases原始来源