llama.cpp b11026发布:TENSOR_SKIP时跳过gate_up_exps
该版本让qwen35moe在MTP张量已融合但未加载时能正常处理,同时发布了覆盖macOS、Linux、Windows、Android等平台的预编译包。
llama.cpp发布b11026,提交信息为“model : skip gate_up_exps if TENSOR_SKIP is set (#29014)”,说明该改动是qwen35moe在MTP张量已融合但未加载时所必需的。
该版本同时提供多平台预编译二进制,包括macOS Apple Silicon(arm64)与Intel(x64)、iOS XCFramework、Ubuntu(x64/arm64/s390x CPU、Vulkan、CUDA 12.8与 13.3、ROCm 10.0、OpenVINO、SYCL FP32/FP16)、Windows(x64/arm64 CPU、OpenCL Adreno、CUDA 12.4与 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0)、Android arm64,以及UI包。
发布说明中,macOS Apple Silicon的KleidiAI加速版和openEuler相关构建均标注为DISABLED。