llama.cpp b11270:HIP后端用 __vsub4优化打包字节减法
llama.cpp发布b11270构建,改动集中在ggml-cuda的HIP路径:把非饱和打包字节减法从 __vsubss4换成 __vsub4,并在CI中忽略fattn_vec的 1 个溢出vgpr。
llama.cpp发布b11270版本,主仓库的发布说明列出两条改动:ggml-cuda的HIP后端把非饱和打包字节减法由 __vsubss4改为 __vsub4;同时CI在fattn_vec中忽略 1 个溢出的vgpr。
提交信息显示该改动由Carl Philipp Klemm共同署名。发布说明未给出性能数字或基准结果。
b11270沿用该项目的常规发布形式,附带各平台预编译包:macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework,以及Linux、Android、Windows的CPU、Vulkan、CUDA 12 / CUDA 13、ROCm 10.0、OpenVINO、SYCL等构建。
其中Linux侧还包含Ubuntu s390x(CPU)、Snapdragon(CPU、Adreno GPU、Hexagon NPU)构建;Windows侧包含arm64的OpenCL Adreno与CUDA 13构建。
openEuler相关构建在本次发布中标注为DISABLED;macOS Apple Silicon的KleidiAI启用版本同样标注DISABLED。
发布页还提供单独的UI包和对应CUDA运行库压缩包。