开源llama.cpp Releases·原文 2026年9月17日

llama.cpp b11009修复Gemma 4与Qwen3.5融合QKV的张量并行拆分

该版本针对 --fuse-qkv场景重算attn_qkv拆分状态,并以n_embd_head_k处理Gemma 4中n_embd 5376与Q维度 8192 不一致的问题。

AI解读:llama.cpp发布b11009版本,主要改动是修复张量并行(TP)下融合QKV的拆分状态和粒度,涉及Gemma 4和Qwen3.5两个模型系列。

之前按嵌入维度拆分融合QKV在Gemma 4上会算错——它的n_embd是 5376,但Q实际是 8192,两者对不上。这次改为从n_head推算attn_qkv的拆分状态,并引入n_embd_head_k。

Qwen3.5和Qwen3.5 MoE的融合全注意力层也在本次处理范围内,代码里还留了一个关于Qwen QGATE拆分的TODO。

如果你只是单卡或单进程跑推理,这次更新基本无感;只有在多设备张量并行跑Gemma 4、Qwen3.5且启用 --fuse-qkv时,拆分维度才会对上,属于面向多卡部署的修复。

llama.cpp发布b11009构建版本,提交号为 #28965,标题为「TP: fix split state and granularity for fused QKV gemma4, qwen35」。改动针对张量并行(TP)模式下融合QKV的拆分状态与粒度。

具体来说,`attn_qkv` 的拆分状态改为从 `n_head` 计算。发布说明指出,在Gemma 4配合 `--fuse-qkv` 使用时需要 `n_embd_head_k`,因为该模型 `n_embd` 为 5376,而Q为 8192,两者数值不一致。

同一提交还处理了Qwen3.5和Qwen3.5 MoE的融合全注意力层,并留下一处TODO,标记为 `[TAG_SPLIT_QGATE_QWEN]`。

信息来源

llama.cpp Releases原始来源