开源llama.cpp Releases·原文 2026年9月24日

llama.cpp发布v0.5.0:新增HRM-Text等模型支持,服务器可绑定多地址

该版本同步ggml 0.25.0,为CUDA conv2d、Metal MoE与SSM_CONV带来性能优化,并修复路由竞争、聊天解析器与多模态检查等问题。

AI解读:llama.cpp v0.5.0是一个以推理后端性能、模型覆盖面和服务器稳定性为主的版本,同步了ggml 0.25.0。它面向的是自己编译或部署llama.cpp的开发者和运维者,而非普通终端用户。

最直接的变化在服务端:现在允许一次绑定多个地址,--host可接受逗号分隔的TCP地址和UNIX socket。这对需要同时监听本地与局域网、或多网卡的部署场景更实用,不用再为每个地址起一个进程。

模型支持新增HRM-Text(DFM Mimir 1B)、MiMo-V2.6转换和HunyuanOCR的DFlash,另有Nemotron、Qwen4Exp、Muse Glimmer等架构的适配。这意味着这些模型能以更低成本在本地或自建服务中运行,但转换与量化仍需按仓库流程操作。

API层面新增从已打开FILE加载LoRA的接口,并明确load_from_file_ptr从当前位置读取、需要对齐的mmap。对在自定义进程里管理文件句柄的集成方来说,少了一次重新打开文件。

性能方面,CUDA conv2d用隐式GEMM加速,Metal增加MoE与SSM_CONV融合优化,CUDA graph用于MTP草稿。这些属于推理速度优化,具体提升幅度需按硬件与模型自测,发布说明没有给出统一数字。

发布说明还列出服务器路由竞争与子进程生命周期修复、不再向router子进程传递日志文件和API key文件、多模态sanity check,以及WEBM视频、移动端布局等UI修复。是否升级取决于你是否用到对应模型或服务端多地址能力。

llama.cpp发布v0.5.0,发布说明称本次更新聚焦后端性能与正确性、更广的模型覆盖,以及更稳健的服务器/路由运行。

该版本新增HRM-Text(DFM Mimir 1B)支持、MiMo-V2.6与HunyuanOCR转换支持,并同步ggml 0.25.0后端改进。

服务器现在允许绑定多个地址(#28690,对应提交 217f81c26);--host可接受逗号分隔的TCP地址和UNIX socket。

API变更包括新增llama_adapter_lora_init_from_file_ptr()(#28993,提交 7ceed8737附近),用于从已打开的FILE加载LoRA;并文档化llama_model_load_from_file_ptr() 从当前位置读取且要求对齐的mmap。

新增LLAMA_VOCAB_TYPE_TEST哑元tokenizer(#29084,提交efa28e950);服务器函数调用输出新增input_image支持(#22575 / #20663,提交 4098fdc92)。

发布说明同时列出模型、核心、服务器、UI与ggml多类改动,并给出自v0.4.1以来的完整changelog。

信息来源

llama.cpp Releases原始来源