开源llama.cpp Releases·原文 2026年10月1日

llama.cpp发布b11294,新增llama_prefetch_rows行预取并登陆Windows

该版本引入llama_prefetch_rows行预取功能,由Pranesh Gonegandla贡献的Windows移植版被原样合并;预取仅在lazy模式下启用,并通过llama-impl路由避免在模型代码中暴露llama-mmap。

AI解读:llama.cpp的b11294构建加入了一个叫llama_prefetch_rows的行预取功能,意思是在模型加载/推理时按“行”提前把数据取到手边,而不是等用到时再去取。它的直接作用是让惰性加载(lazy模式)下的内存访问更顺,减少等待。

PR #29599 把Windows上的移植版原样合并进来,贡献者署名Pranesh Gonegandla,共同作者包括Georgi Gerganov。代码层面还做了一件事:不让模型代码直接碰llama-mmap,而是走llama-impl路由,这样内部机制不会被上层误用。

限制是明确的:预取只在lazy模式下生效,而且增加了Windows检查。同时这个版本还顺手澄清了gemma4的padding token。这些都不是通用加速承诺,而是局部路径的调整,用的人得先确认自己是不是在lazy模式、跑的是不是对应平台。

llama.cpp发布b11294版本,主要变更是新增llama_prefetch_rows行预取功能(PR #29599)。

该PR的Windows移植由Pranesh Gonegandla贡献并被原样合并,共同作者包括Georgi Gerganov。

按提交说明,预取仅在lazy模式下启用,并增加了Windows检查;同时避免在模型代码中暴露llama-mmap,改为通过llama-impl路由。

同一PR还包含对gemma4 padding token的说明性修改。

PR #29599 的提交内容

llama.cpp在b11294构建中合并了PR #29599,标题为「llama: llama_prefetch_rows」。

提交列表显示:新增llama_prefetch_rows;为Windows提供行预取支持,采用 @praneshgo贡献的Windows移植版且未做改动;避免在模型代码中暴露llama-mmap,改由llama-impl路由;增加Windows检查;预取只在lazy模式进行;随后是清理、修构建,以及澄清gemma4的padding token。

发布产物覆盖平台

该版本的下载列表覆盖macOS/iOS、Linux、Android、Windows和openEuler,并包含UI包。

Linux侧提供Ubuntu x64/arm64/s390x(CPU)、Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO 2026.4,以及SYCL FP32/FP16,另有Snapdragon(CPU、Adreno GPU、Hexagon NPU)包。

Windows侧提供x64/arm64(CPU)、arm64(OpenCL Adreno)、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0等构建;macOS提供Apple Silicon arm64与Intel x64包,以及iOS XCFramework。

列表中macOS Apple Silicon(启用KleidiAI)和openEuler相关构建标注为DISABLED,并附有对应PR编号 23780 与 23705。

信息来源

llama.cpp Releases原始来源