llama.cpp发布b11182:新增llama_prec_policy与模型驱动的W4A4路径
该版本提交标题为「llama : add llama_prec_policy + model-driven W4A4 path (#24364)」,由ynankani提交,Georgi Gerganov与Johannes Gäßler参与共同署名。
AI解读:llama.cpp这次更新加了一个叫llama_prec_policy的机制,并给模型提供了一条由模型自身驱动的W4A4推理路径。W4A4指权重和激活都压到 4 位,理论上能明显压低显存和算力开销,这也是本地跑大模型的常见瓶颈。
从提交记录看,改动不止在llama层,还动到了ggml的CUDA量化矩阵乘(mmq.cu),并包含针对MXFP4在高源精度下的dispatch调整。也就是说,这不是纯接口层的开关,而是量化计算路径上的改动。
需要注意,来源是版本发布页摘要和提交标题,只支持到「新增了什么」这一层。它没有给出精度损失、吞吐提升或具体支持哪些模型的数据,所以现在还不能判断这条W4A4路径在实际使用中的可用范围。
对直接相关的人是本地部署和量化模型的开发者:新参数和模型驱动的精度策略意味着以后可能由模型自己声明部分层的精度取舍,而不是全靠使用者手动配。但要真正用上,得等文档说明和评测数据。
llama.cpp发布b11182版本,该版本合并了提交 #24364,标题为「llama : add llama_prec_policy + model-driven W4A4 path」。提交由ynankani完成,共同署名者包括Georgi Gerganov和Johannes Gäßler。
版本说明中列出的改动要点包括:CI失败修复(HIP上的launch_bounds重载问题)及清理、在激活策略映射中改用ggml tensor而不是名称、命名调整,以及针对更高源精度的MXFP4 dispatch改动。
提交历史还显示,改动涉及ggml CUDA量化矩阵乘文件ggml/src/ggml-cuda/mmq.cu。
b11182提供的预编译产物覆盖哪些平台
发布页给出的下载产物覆盖多类平台与后端。
- macOS/iOS:Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework;其中启用KleidiAI的macOS Apple Silicon版本标注为DISABLED。
- Linux:Ubuntu x64与arm64的CPU版、s390x CPU版、Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO 2026.4、SYCL FP32与SYCL FP16;CUDA版本附带对应的cudart库。
- Linux arm64提供Snapdragon版本,覆盖CPU、Adreno GPU、Hexagon NPU,并附有安装指南链接。
- Android:arm64 CPU版,以及arm64 Snapdragon(CPU、Adreno GPU、Hexagon NPU)版,附安装指南链接。
- Windows:x64与arm64 CPU版、arm64 OpenCL Adreno版、CUDA 12.4、CUDA 13.4(x64与arm64)、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0;CUDA版本附带对应DLL。
- openEuler:x86 310p、x86 910b(ACL Graph)、aarch64 310p、aarch64 910b(ACL Graph)均标注为DISABLED。
- 此外提供UI压缩包。