开源llama.cpp Releases·原文 2026年10月1日

llama.cpp发布b11304:修复训练时KV处理

llama.cpp新构建b11304的代码变更条目为“llama: properly handle KV on training (#28520)”,同时发布了覆盖macOS、Linux、Windows、Android等多平台的预编译包。

AI解读:llama.cpp这次发布的核心是一条代码改动:在训练场景下正确处理KV(键值缓存),对应PR #28520。KV缓存是推理时缓存注意力键值、避免重复计算加速生成的东西;训练流程同样会碰到它,之前的处理被认为不够正确。

对使用llama.cpp做微调或训练相关实验的人来说,这属于底层行为修正,不是新功能。它不会改变模型能力或推理速度,但会影响训练路径上KV的状态管理是否按预期工作。

发布同时提供了macOS、Linux、Windows、Android等平台的大量预编译包,含CUDA 12.8/13.4、ROCm 10.0、Vulkan、SYCL、OpenVINO等后端变体。需要这些构建的人在各自平台按对应链接下载即可;单条改动说明有限,实际影响要看具体训练流程是否命中相关代码路径。

llama.cpp发布构建版本b11304(仓库为ggml-org/llama.cpp),发布说明中列出的代码变更条目是“llama: properly handle KV on training (#28520)”,并附有“improve”字样。

该条目指向PR #28520,标题为“llama: properly handle KV on training”,即让llama.cpp在训练时正确处理KV。发布说明本身只有这一条变更描述,没有给出更多实现细节、测试数据或性能数字。

与代码变更一同发布的还有各平台预编译产物,包括macOS/iOS、Linux、Android、Windows、openEuler和UI。

b11304的预编译包覆盖哪些平台和后端

发布页按平台列出下载链接。macOS/iOS方面提供macOS Apple Silicon(arm64)、macOS Intel(x64)和iOS XCFramework;其中macOS Apple Silicon的KleidiAI启用版本标注为DISABLED,并链接到PR #23780。

Linux方面提供Ubuntu x64(CPU)、Ubuntu arm64(CPU)、Ubuntu s390x(CPU)、Ubuntu x64(Vulkan)、Ubuntu arm64(Vulkan)、Ubuntu x64(CUDA 12,对应CUDA 12.8库)、Ubuntu x64(CUDA 13,对应CUDA 13.4库)、Ubuntu arm64(CUDA 13,对应CUDA 13.4库)、Ubuntu x64(ROCm 10.0)、Ubuntu x64(OpenVINO,2026.4)、Ubuntu x64(SYCL FP32)、Ubuntu x64(SYCL FP16),以及Linux arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU,附setup guide)。

Android方面提供Android arm64(CPU)和Android arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU,附setup guide)。

Windows方面提供Windows x64(CPU)、Windows arm64(CPU)、Windows arm64(OpenCL Adreno)、Windows x64(CUDA 12,对应CUDA 12.4 DLL)、Windows x64(CUDA 13,对应CUDA 13.4 DLL)、Windows arm64(CUDA 13,对应CUDA 13.4 DLL)、Windows x64(Vulkan)、Windows x64(OpenVINO 2026.4)、Windows x64(SYCL)、Windows x64(ROCm 10.0)。

openEuler相关的四项构建标注为DISABLED,链接到PR #23705,包括openEuler x86(310p)、openEuler x86(910b,ACL Graph)、openEuler aarch64(310p)、openEuler aarch64(910b,ACL Graph)。此外还单独提供UI包。

信息来源

llama.cpp Releases原始来源