开源llama.cpp Releases·原文 2026年10月1日

llama.cpp发布b11306:测试脚本切换causal_attn以捕捉计算图形状变化

llama.cpp新版本b11306的测试脚本新增一项检查:在设备解码后关闭causal_attn标志,分别解码n_ubatch/2和n_ubatch个token,用于发现依赖该标志的图形状变化。该检查跳过编码类架构。

AI解读:llama.cpp发布了b11306版本,本次更新主要落在测试环节:test-llama-archs新增对causal_attn标志的切换测试。

这项测试的做法是,在设备解码之后关闭causal_attn,先解码n_ubatch/2个token,再解码n_ubatch个token。两次解码的节点数量相同,因此如果某个计算图形状依赖于这个标志,第二次就会在图形尺寸不变的情况下触发重新分配。

在GGML_SCHED_NO_REALLOC条件下,这种重新分配会直接中止运行,从而把潜在的形状依赖问题暴露出来。测试对编码类架构跳过这一检查。

对使用llama.cpp的开发者来说,这条更新本身不改变推理行为,但它意味着此类图形状回归以后有机会在测试阶段被拦住,而不是等到运行时才炸出来。

llama.cpp发布b11306版本,该版本包含一项测试脚本改动:在test-llama-archs中切换causal_attn标志,以捕捉计算图形状变化(PR #29724)。

改动内容为:在设备解码之后关闭causal_attn,先解码n_ubatch/2个token,再解码n_ubatch个token。由于两次解码的节点数量相同,若存在依赖该标志的计算图形状,第二次解码会在图形尺寸不变的情况下触发重新分配。

在GGML_SCHED_NO_REALLOC条件下,这种重新分配会导致中止,从而让问题在测试中暴露。该检查对编码类架构跳过。

b11306同时提供macOS/iOS、Linux、Android、Windows等平台的预编译二进制包,覆盖CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL等后端。其中macOS Apple Silicon的KleidiAI启用版本仍处于禁用状态,openEuler构建也已禁用。

信息来源

llama.cpp Releases原始来源