llama.cpp b11309发布:优化Hexagon ALLREDUCE,支持安全scatter模式
llama.cpp发布b11309版本,主要变更是为Hexagon后端的ALLREDUCE操作增加安全scatter模式支持,并重写相关代码以消除寄存器溢出。同步更新了macOS、Linux、Windows、Android等多平台预编译包。
AI解读:这条更新真正改动的是llama.cpp在Hexagon NPU上的多设备通信效率:ALLREDUCE负责把多个计算单元的中间结果汇总, scatter模式决定汇总结果怎么写回内存,新增的“安全”版本意味着写回不再越界或踩坏其他数据。
对普通用户来说,最直接的变化是Snapdragon设备(手机、Windows on Arm笔记本)跑本地大模型时,Hexagon NPU多核协作的开销可能降低。但来源只给出优化意图和代码改动,没有附上具体的速度或功耗测试数据,所以“快多少”目前无法量化。
如果你在用Snapdragon平台跑llama.cpp,可以下载b11309的Linux arm64或Android arm64 Snapdragon预编译包,按仓库里的setup guide启用Hexagon NPU;如果不涉及Hexagon,这次发布的其他平台二进制基本只是例行同步,没有值得专门升级的理由。
llama.cpp发布b11309版本,主要变更是为Hexagon后端优化ALLREDUCE操作,并加入对安全scatter模式(safe scatter mode)的支持。
提交信息显示,改动包括三部分:为hex-allreduce增加安全scatter模式支持、精简过多注释、重写实现以消除寄存器溢出(register spills)。提交由Max Krasnyansky共同署名。
该版本照例附带各平台预编译二进制,包括macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework、Linux(Ubuntu x64/arm64/s390x,Vulkan、CUDA 12.8/13.4、ROCm 10.0、OpenVINO、SYCL FP32/FP16)、Android arm64(CPU及Snapdragon CPU/Adreno GPU/Hexagon NPU)、Windows(CPU、OpenCL Adreno、CUDA、Vulkan、OpenVINO、SYCL、ROCm)以及UI包。
来源同时标注了两项DISABLED内容:macOS Apple Silicon的KleidiAI启用版本被禁用(关联PR #23780),openEuler平台构建也被禁用(关联PR #23705)。