开源llama.cpp Releases·原文 2026年9月27日

llama.cpp b11206发布:Hexagon后端支持采样器

llama.cpp新版本b11206为Hexagon后端加入采样器支持,涉及TOPK、STEP、SUM、CPY、ARGMAX、ARGSORT等算子,并修复部分运算索引与性能回归问题。

llama.cpp发布b11206版本,提交信息显示该版本为Hexagon后端加入了对采样器(backend sampler)的支持,对应PR #29502。

改动覆盖多个Hexagon算子:hex-topk尝试改进并清理流水线,hex-sampling新增STEP算子,hex-sampler新增SUM算子,hex-sampler更新CPY以支持采样场景。

其他改动包括:hex-binary支持分块以处理大logits,hex-argmax提供基础ARGMAX版本,hex-binary支持扩展缓冲区中的标量,修复dim 1广播跨dim 2切片时索引错误,hex-argsort补上缺失的头文件。

性能与构建方面,hex-sampler清理了采样相关算子和binary的DMA使用,hex-build关闭自动向量化,理由是关键循环更适合用显式提示,hex-binary修复了is_1d回退导致的性能回归,hex-ops更新了支持的算子。

发布页同时提供各平台预编译包,包括macOS/iOS、Linux、Android、Windows、openEuler和UI。其中Android arm64的Snapdragon包标注支持CPU、Adreno GPU和Hexagon NPU,并链接了设置指南。

macOS Apple Silicon的KleidiAI启用版本标记为DISABLED,openEuler构建同样标记为DISABLED。这些包状态沿用此前PR的禁用说明。

信息来源

llama.cpp Releases原始来源