llama.cpp b11006发布:Hexagon后端新增Q4_K、Q6_K量化内核支持
该版本为高通Hexagon数字信号处理器实现了K-Quants系列中Q4_K与Q6_K的内核支持,由Max Krasnyansky联合署名,同时发布了覆盖macOS、Linux、Windows、Android等平台的预编译二进制包。
AI解读:llama.cpp的第b11006号版本给Hexagon后端加上了Q4_K和Q6_K两种量化格式的内核支持。Hexagon是高通芯片里的DSP,通常出现在骁龙手机和部分笔记本的NPU里,此前它并不能直接跑这两种常用的量化权重。
从提交记录看,这项工作由三个补丁合并而成:先实现Q6_K内核,再改进其解包精度,最后补上Q4_K支持。实际影响很具体:想在骁龙设备的Hexagon上跑 4-bit量化模型的人,现在不必再退回到精度更差的旧格式或纯CPU路径。
不过发布说明只写了内核实现本身,没有给出推理速度或精度对比数据,所以能提升多少、功耗怎样,目前只能自己实测判断。其余内容就是各平台常规的预编译包,没有额外功能变化。
llama.cpp发布b11006版本,为Hexagon后端新增K-Quants量化格式Q4_K与Q6_K的内核支持(#28994)。
该改动由Max Krasnyansky联合署名,合并自三个补丁:实现Q6_K内核、改进hex-q6k解包精度、为Q4_K增加内核支持。
发布说明同时列出macOS/iOS、Linux、Android、Windows及openEuler平台的预编译二进制包,包括CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO 2026.3.1、SYCL FP32/FP16等构建变体,以及UI压缩包。