llama.cpp b11054为Hexagon后端启用TOP_K算子
llama.cpp发布b11054版本,主要变更是为Hexagon后端启用TOP_K算子,并附带针对单行、行分区和大行选择的优化。
AI解读:这次不只是打开开关。同一批提交里还处理了单行TOP_K的多线程、提高了基于VTCM的尺寸上限、修复了TOP_K的mdev行分区问题,并针对大行选择做了优化。对在Hexagon上跑推理的人来说,长候选列表和单行场景的可用范围可能因此变大,但来源没有给出性能数字,具体提升幅度无法确认。
b11054同时照例提供各平台预编译包,包括macOS、iOS、Linux、Android、Windows,以及Vulkan、CUDA、ROCm、OpenVINO、SYCL等后端变体。openEuler构建仍标记为DISABLED。
llama.cpp发布b11054版本,主要变更是为Hexagon后端启用TOP_K算子(#29113)。
提交记录显示,该项工作还包括:对单行TOP_K做多线程处理、提高基于VTCM的尺寸上限、修复TOP_K的mdev行分区、优化TOP_K大行选择、清理注释格式,以及更新文档中的TOP_K支持列表。
该版本照常提供各平台预编译包,覆盖macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework、Linux(Ubuntu x64/arm64/s390x、Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO、SYCL FP32/FP16)、Android arm64、Windows(CPU x64/arm64、OpenCL Adreno arm64、CUDA 12、CUDA 13、Vulkan、OpenVINO、SYCL、ROCm 10.0)。
其中macOS Apple Silicon的KleidiAI启用版本标记为DISABLED,openEuler构建同样标记为DISABLED。