开源llama.cpp Releases·原文 2026年10月2日

llama.cpp b11324发布:llama-mmap用direct-io避免每个张量出现第二份全尺寸拷贝

llama.cpp发布b11324版本,主要变更是llama-mmap在direct-io下不再为每个张量保留第二份完整拷贝;该改动由Pranesh Gonegandla共同完成,并标注Claude协助。

AI解读:llama.cpp的b11324版本把改动重点放在内存映射上:llama-mmap在direct-io模式下避免为每个张量再生成一份全尺寸拷贝。对于靠llama.cpp在本地跑模型的人来说,这直接关系到加载模型时的内存占用。

这条发布记录只给出改动标题和协作信息,没有附带具体的节省数字或测试结果。因此目前能确定的是改动意图和代码归属,实际收益需要按模型和硬件条件自行验证。

llama.cpp发布b11324版本,其中一项改动为llama-mmap:在使用direct-io时,避免为每个张量产生第二份全尺寸拷贝(#29749)。

该改动标注Assisted-by: Claude,由Pranesh Gonegandla共同完成(Co-authored-by)。

发布页面同时列出了各平台构建产物,包括macOS/iOS、Linux、Android、Windows与UI等下载项。

llama-mmap在direct-io下的内存拷贝改动

b11324版本的改动标题为“llama-mmap : avoid a second full-size copy of each tensor with direct-io (#29749)”,即在使用direct-io时避免每个张量出现第二份全尺寸拷贝。

该改动列出的协作者为Pranesh Gonegandla,并标注Assisted-by: Claude。

发布说明没有给出该改动带来的内存节省比例、性能数据或适用模型范围等进一步细节。

b11324提供的构建产物

发布页列出了macOS/iOS、Linux、Android、Windows以及UI等平台的构建产物下载项。

macOS部分包含Apple Silicon(arm64)与Intel(x64)版本,以及iOS XCFramework;其中“macOS Apple Silicon(arm64,KleidiAI enabled)”一项标注为DISABLED。

Linux部分覆盖Ubuntu x64与arm64的CPU构建,以及Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO、SYCL FP32/FP16等后端构建,另有Linux arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU)构建与设置指南链接。

Android部分提供arm64(CPU)与arm64(Snapdragon:CPU、Adreno GPU、Hexagon NPU)构建,并附设置指南链接。

Windows部分提供x64与arm64的CPU构建、arm64(OpenCL Adreno)构建,以及CUDA 12、CUDA 13、Vulkan、OpenVINO、SYCL、ROCm 10.0等后端构建,并附带对应的CUDA运行时库。

openEuler相关构建标注为DISABLED,指向pull/23705。

发布页还单独提供UI构建产物。

信息来源

llama.cpp Releases原始来源