llama.cpp发布b10886:为s390x架构补上Q1_0向量点积支持
该版本由Aaron Teo提交 #28606,在ggml-cpu中新增ggml_vec_dot_q1_0_q8_0的s390x向量内建实现,并同步更新Q1_0支持状态文档。
AI解读:llama.cpp的新构建b10886做了一件很窄但具体的事:让跑在IBM s390x大型机架构上的ggml-cpu后端,能用自己的向量内建指令算Q1_0量化格式的点积。
这条改动的实际受益者是在s390x机器上部署llama.cpp的人。此前这类机器缺少针对Q1_0的向量实现,只能走更通用的代码路径;现在多了一条可被编译器利用的专用路径,理论上同类推理工作负载在这类硬件上会更快。
需要说明的是,来源只给出改动内容和构建产物列表,没有任何实测速度、相对提升比例或与其他架构的对比数据,所以具体快多少目前无法判断。
llama.cpp发布了构建版本b10886。该版本的主要改动记录为:在ggml-cpu的s390x后端新增Q1_0向量内建(intrinsic)支持,对应PR #28606。提交者署名为Aaron Teo。
改动内容与关联PR
根据发布说明,本次改动包含三项:为ggml-cpu添加ggml_vec_dot_q1_0_q8_0支持;清理变量命名以便理解;更新文档中Q1_0的支持状态。三项均为Signed-off-by: Aaron Teo,关联PR编号 #28606。
Q1_0是llama.cpp所用ggml量化格式之一,q8_0是与之配对参与点积计算的另一种格式;新增的函数名ggml_vec_dot_q1_0_q8_0表明这条路径处理的是Q1_0权重与Q8_0激活之间的向量点积。
发布产物覆盖的平台
该版本同时提供多个平台的预编译产物。macOS/iOS方面包括macOS Apple Silicon(arm64)、macOS Intel(x64)和iOS XCFramework;其中标注KleidiAI enabled的macOS Apple Silicon版本状态为DISABLED,并指向PR #23780。
Linux方面提供Ubuntu x64(CPU)、Ubuntu arm64(CPU)、Ubuntu s390x(CPU),以及Ubuntu x64/arm64的Vulkan构建,还有x64的ROCm 10.0、OpenVINO 2026.3.1、SYCL FP32和SYCL FP16构建。
其他平台包括Android arm64(CPU);Windows的x64/arm64(CPU)、arm64(OpenCL Adreno)、x64的CUDA 12.4与 13.3、arm64的CUDA 13.4预览版、Vulkan、OpenVINO 2026.3.1、SYCL、ROCm 10.0,以及对应的CUDA DLL包;另有独立的UI包。openEuler相关下载标记为DISABLED,并指向PR #23705。