llama.cpp b11035为Vulkan后端加入IQ3_S MMQ矩阵乘核
llama.cpp发布b11035构建,变更记录显示本次为Vulkan后端新增IQ3_S MMQ matmul内核,并同步提供Vulkan、CUDA、ROCm、SYCL、OpenVINO等多平台预编译包。
llama.cpp发布b11035版本,变更日志显示本次合入的PR #28822 为Vulkan后端添加了IQ3_S MMQ matmul内核。来源为llama.cpp Releases页面,发布方为github-actions[bot]。
同一变更记录还包含两项实现调整:让block_a_to_shmem执行 2 字节加载,理由是 110 字节可被 2 整除;以及对检查逻辑做对齐,因为IQ3_S也使用K tile尺寸。
b11035同时提供多平台预编译构建产物,包括macOS Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework、Ubuntu x64/arm64/s390x(CPU)、Ubuntu x64/arm64(Vulkan)、Ubuntu x64 CUDA 12.8与CUDA 13.3、Ubuntu arm64 CUDA 13.3、Ubuntu x64 ROCm 10.0、Ubuntu x64 OpenVINO、Ubuntu x64 SYCL FP32与SYCL FP16、Android arm64(CPU)、Windows x64/arm64(CPU)以及Windows各后端构建。
发布说明中macOS Apple Silicon的KleidiAI加速版本标注为DISABLED,并指向PR #23780;openEuler的x86 310p、x86 910b(ACL Graph)、aarch64 310p、aarch64 910b(ACL Graph)条目同样标注为DISABLED,并指向PR #23705。
以上事实均来自该发布页面的摘要信息,未涉及具体性能数据、兼容性测试结果或量化精度变化。