llama.cpp发布b11173:修复Metal图捕获并处理空图
llama.cpp版本b11173修复了Metal后端的图捕获逻辑,空图提前返回,捕获计数器不再冗余重置,并在捕获错误提示中建议设置METAL_CAPTURE_ENABLED=1。
AI解读:llama.cpp发布b11173,主要改动集中在Metal后端的图捕获(graph capture)逻辑。对使用苹果芯片跑本地推理的人来说,这类修复通常影响的是GPU计算图能否被正确捕获和复用,而不是模型能力本身。
这次修复处理了空图场景,并让捕获流程只执行一次,避免重复捕获或状态错乱。它不会带来速度提升的公开数字,属于稳定性修补。
受影响的主要是依赖Metal后端在macOS/iOS上运行llama.cpp的开发者和用户;如果你不启用图捕获,或主要用CPU、CUDA、Vulkan等后端,感知会很有限。具体效果仍取决于你使用的模型和运行配置,来源没有提供性能数据。
llama.cpp发布了构建版本b11173,其中包含一个针对Metal后端的修复:修正图捕获逻辑并处理空图(PR #29390)。
根据发布说明,改动包括:当图没有节点时提前返回;移除capture_compute的冗余重置,因为函数顶部的递减已经让计数器从 0 变为 -1,从而保证捕获只发生一次;在捕获错误信息中提示METAL_CAPTURE_ENABLED=1;向ggml_metal_op_init传入capture_compute == 0(而不是原始计数器)作为use_capture,使GPU调试组标记只在被捕获的计算中发出。
该提交标注Assisted-by: pi:llama.cpp/Qwen3.8-27B。发布页面同时提供macOS/iOS、Linux、Android、Windows、openEuler以及UI的多平台预编译包链接。