llama.cpp发布b11090:修复CUDA sm_70(Volta)tile编译错误
更新由PR #29224 完成,针对 1884824fd引入的 5 参数load_ldmatrix只定义单一tile形状的问题,将其tile形状泛化,使非swizzle分支对任意形状都回退到 3 参数loader;作者称本地编译与测试通过。
AI解读:这次更新只做了一件事:修好Volta(sm_70)显卡上的CUDA编译错误。问题出在之前一个改动引入的 5 参数load_ldmatrix只定义了一种tile形状,Volta用的tile对不上,于是构建直接失败。
受影响的是仍用Volta架构(如V100)跑CUDA后端并自行编译llama.cpp的人。上游同时放出了Windows、Linux、macOS等平台的预编译包,不想折腾编译的可以直接下载对应版本。
值得注意的是协助署名里出现了“DeepSeek V4.1 Flash (OpenCode)”,也就是这次修复由AI工具参与完成。作者只表示本地编译和测试通过,没有给出更广范围的验证数据。
llama.cpp发布b11090,修复CUDA后端在sm_70(Volta)上的tile编译错误,对应PR #29224。
问题源自提交 1884824fd引入的 5 参数load_ldmatrix:它只定义了单一tile形状,Volta的tile与之不匹配,导致编译失败,相关细节见issue #29222。
修复方式是在 1884824fd的基础上,把 5 参数load_ldmatrix的tile形状泛化,使非swizzle分支对任意形状都转发到 3 参数loader。
作者称本地编译和测试通过,并在提交信息中标注Assisted-by: DeepSeek V4.1 Flash (OpenCode)。
b11090提供的预编译包
发布页同时列出各平台预编译产物,覆盖macOS/iOS、Linux、Android、Windows,以及被标记为DISABLED的openEuler和KleidiAI构建。
- macOS/iOS:macOS Apple Silicon (arm64)、macOS Intel (x64)、iOS XCFramework。
- Linux:Ubuntu x64/arm64/s390x (CPU)、Ubuntu x64与arm64 (Vulkan)、Ubuntu x64 (CUDA 12.8)、Ubuntu x64与arm64 (CUDA 13.4)、Ubuntu x64 (ROCm 10.0)、Ubuntu x64 (OpenVINO 2026.4)、Ubuntu x64 (SYCL FP32/FP16)。
- Android:Android arm64 (CPU)。
- Windows:x64与arm64 (CPU)、arm64 (OpenCL Adreno)、x64 (CUDA 12.4)、x64与arm64 (CUDA 13.4)、x64 (Vulkan)、x64 (OpenVINO 2026.4)、x64 (SYCL)、x64 (ROCm 10.0)。
- openEuler:x86 (310p)、x86 (910b, ACL Graph)、aarch64 (310p)、aarch64 (910b, ACL Graph) 均标注为DISABLED。
- 另有独立的UI包,以及各CUDA版本对应的运行库压缩包。