开源llama.cpp Releases·原文 2026年9月20日

llama.cpp b11054为Hexagon后端启用TOP_K算子

llama.cpp发布b11054版本,主要变更是为Hexagon后端启用TOP_K算子,并附带针对单行、行分区和大行选择的优化。

AI解读:这次不只是打开开关。同一批提交里还处理了单行TOP_K的多线程、提高了基于VTCM的尺寸上限、修复了TOP_K的mdev行分区问题,并针对大行选择做了优化。对在Hexagon上跑推理的人来说,长候选列表和单行场景的可用范围可能因此变大,但来源没有给出性能数字,具体提升幅度无法确认。

b11054同时照例提供各平台预编译包,包括macOS、iOS、Linux、Android、Windows,以及Vulkan、CUDA、ROCm、OpenVINO、SYCL等后端变体。openEuler构建仍标记为DISABLED。

llama.cpp发布b11054版本,主要变更是为Hexagon后端启用TOP_K算子(#29113)。

提交记录显示,该项工作还包括:对单行TOP_K做多线程处理、提高基于VTCM的尺寸上限、修复TOP_K的mdev行分区、优化TOP_K大行选择、清理注释格式,以及更新文档中的TOP_K支持列表。

该版本照常提供各平台预编译包,覆盖macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework、Linux(Ubuntu x64/arm64/s390x、Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO、SYCL FP32/FP16)、Android arm64、Windows(CPU x64/arm64、OpenCL Adreno arm64、CUDA 12、CUDA 13、Vulkan、OpenVINO、SYCL、ROCm 10.0)。

其中macOS Apple Silicon的KleidiAI启用版本标记为DISABLED,openEuler构建同样标记为DISABLED。

信息来源

llama.cpp Releases原始来源