开源llama.cpp Releases·原文 2026年9月17日

llama.cpp b11005修复Hexagon后端rope探测:拒绝零参数rope会把rope_freqs扔回CPU

llama.cpp发布b11005构建,Hexagon后端在supports_op中接受llama用于探测权重放置的全零rope;此前拒绝n_dims==0 或freq_base==0 会让rope_freqs落在CPU,导致每个全注意力层处解码图被切分(gemma-4-E2B为 5 次切分而非 2 次)。

llama.cpp发布b11005构建,其中一项修复针对Hexagon后端:supports_op现在接受参数全为 0 的rope探测。

全零rope是探针,不是真实运算

发布说明称,llama会用一条所有参数都为 0 的rope来探测权重的放置位置。如果后端因此拒绝n_dims == 0 或freq_base == 0,就会把rope_freqs放到CPU上。

这会使得解码图在每个全注意力层处被切开;发布说明举的例子是gemma-4-E2B上出现 5 次切分而不是 2 次。

该修复让Hexagon后端接受这条零值探测,从而避免上述切分。发布说明标注Assisted-by: Claude Opus 5。

  • 修复位于llama.cpp b11005的Hexagon后端supports_op。
  • llama以全零参数的rope探测权重放置。
  • 拒绝n_dims == 0 或freq_base == 0 会让rope_freqs落在CPU。
  • gemma-4-E2B例子中切分从 2 次变为 5 次。

信息来源

llama.cpp Releases原始来源