llama.cpp b11109发布:Metal后端将MUL_MAT_ID的src1重缩放改为受ggml_prec控制
该构建在Metal后端把mul_mm_id的src1重缩放逻辑置于ggml_prec门控之下,并让WebGPU与CUDA/Vulkan在src1精度为F32时拒绝MUL_MAT_ID;同步更新各平台预编译产物。
AI解读:这是一次针对后端算子精度处理的补丁。llama.cpp在Metal上不再无条件对mul_mm_id的src1做重缩放,而是交给ggml_prec控制,避免精度设置与后端实现脱节。
同一补丁还收紧了WebGPU、CUDA和Vulkan的行为:当src1精度是F32时,这些后端会拒绝MUL_MAT_ID,supports_op返回false,让上层调度提前知道该路径不可用。
对普通用户来说,无需立即改配置;受影响的是在Metal上跑带MUL_MAT_ID的模型、或依赖WebGPU/CUDA/Vulkan且显式指定src1 F32精度的开发者,行为会按精度门控变化。
能确认的只是补丁与预编译产物更新,公开信息没有给出性能或精度实测数据,因此无法判断这次改动具体带来多少速度或数值收益。
llama.cpp发布b11109构建,提交信息为“metal : gate mul_mm_id src1 rescale behind ggml_prec (#29029)”。该改动把Metal后端中mul_mm_id对src1的重缩放(rescale)改为由ggml_prec门控。
同一补丁还包含两项相关调整:ggml-webgpu在src1精度为F32时拒绝MUL_MAT_ID;CUDA与Vulkan在supports_op中当src1精度为F32时同样拒绝MUL_MAT_ID,使失败后端的supports_op返回false。
提交信息标注Assisted-by: Claude Fable 5.1,Co-authored-by: yomaytk。
b11109同步放出各平台预编译产物,覆盖macOS/iOS、Linux、Android、Windows以及UI包;其中macOS Apple Silicon的KleidiAI启用版本和openEuler相关构建标注为DISABLED。
可下载的平台产物包括Ubuntu x64/arm64/s390x(CPU)、Ubuntu Vulkan、Ubuntu CUDA 12与CUDA 13、Ubuntu ROCm 10.0、Ubuntu OpenVINO、Ubuntu SYCL FP32与FP16,以及Linux arm64骁龙(CPU、Adreno GPU、Hexagon NPU)等。