llama.cpp b11158为Adreno GPU启用Vulkan协作矩阵支持
该版本的核心改动是在Vulkan后端为Adreno GPU开启KHR cooperative matrix(协作矩阵)支持,同时修复mul_mat_s并移除调试语句。
AI解读:llama.cpp发布b11158版本,主改动是调整Vulkan后端对Adreno GPU的KHR cooperative matrix支持——也就是把高通Adreno显卡上的矩阵运算加速路径打开。
对使用骁龙设备跑本地模型的人来说,这属于底层算力路径的调整:Vulkan后端此前是否在Adreno上走协作矩阵并不确定,这次提交把开关打开,并顺手修了mul_mat_s、删掉调试语句。
这类合并请求本身不附带性能数字,所以现在还不能说速度提升多少,需要拿到对应构建版本在自己的设备上实测。
发布页照常提供macOS、iOS、Linux、Android、Windows各平台预编译包,其中Snapdragon专用包明确标注支持CPU、Adreno GPU和Hexagon NPU。
llama.cpp发布b11158版本,该版本合并的改动(编号 #29328)是在Vulkan后端启用对KHR cooperative matrix的支持,并针对Adreno GPU做调整。
提交说明列出三项具体工作:为Vulkan后端启用coopmat支持;修复mul_mat_s;移除调试语句。
发布页未提供性能数据、适用条件或测试结果,改动内容以仓库合并说明为准。
发布物覆盖哪些平台
b11158发布页给出的预编译产物覆盖macOS/iOS、Linux、Android、Windows和openEuler平台。
其中与本次Adreno改动直接相关的是标注Snapdragon的包:Linux arm64与Android arm64各有一个同时包含CPU、Adreno GPU、Hexagon NPU的构建(Linux版和Android版分别附有setup guide);Windows arm64另有一个OpenCL Adreno构建。
macOS Apple Silicon的KleidiAI构建与openEuler构建在本次发布页中被标注为DISABLED,后者的具体条目(openEuler x86 310p、x86 910b ACL Graph、aarch64 310p、aarch64 910b ACL Graph)未附下载链接。
- macOS Apple Silicon arm64、macOS Intel x64、iOS XCFramework
- Ubuntu x64/arm64/s390x CPU版,以及Vulkan x64/arm64版
- Ubuntu CUDA 12.8、CUDA 13.4(x64与arm64)及对应运行时库
- Ubuntu ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16
- Linux arm64 Snapdragon(CPU、Adreno GPU、Hexagon NPU)
- Android arm64 CPU与Android arm64 Snapdragon
- Windows CPU x64/arm64、Windows arm64 OpenCL Adreno
- Windows CUDA 12.4/13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0
- UI包
协作矩阵是什么、这次改了什么
KHR cooperative matrix是Vulkan的扩展(KHR为扩展前缀),用于让着色器利用GPU的矩阵运算单元。Adreno是高通骁龙SoC中的GPU系列。
这次提交的实质是让llama.cpp的Vulkan后端在这类GPU上走协作矩阵路径,并修正mul_mat_s(矩阵乘法相关的kernel/函数名),同时去掉调试输出。
发布说明中没有说明此前为何未启用、启用后是否改变默认行为、是否对所有Adreno型号生效,也没有给出前后性能对比。