开源llama.cpp Releases·原文 2026年10月6日

llama.cpp v0.6.0发布:新增GLM-5.3-Flash与Clef模型支持,引入扩展批处理API

该版本还加入面向决策模型的 /v1/systemone服务端接口、Qwen4Exp的MTP推测解码(官方称DGX Spark上解码约 1.5 倍加速),以及Metal、Vulkan平台的注意力内核更新。

AI解读:llama.cpp发布v0.6.0,版本说明列出了新API、新模型支持、服务端接口、界面与底层内核多项变更。

最核心的接口变化是新增llama_batch_ext扩展批处理API与llama_process(),支持token与embedding混合输入,以及为MTP/deepstack模型提供的逐token状态嵌入。

模型方面新增GLM-5.3-Flash(GLM5-Next,官方描述为 320B文本+视觉混合模型)和Clef决策模型(文本与视觉),并登记LFM2.5-Encoder系列与Ling 3.0 VL等。

服务端新增 /v1/systemone接口用于决策模型(laya、julia-1、lev、openjev、kev,后续扩展至nimble),/v1/embeddings开始接受带类型的视觉/音频/视频输入。

性能方面,官方称Qwen4Exp的MTP推测解码在DGX Spark上解码约 1.5 倍加速,Metal新增少量行MMA矩阵乘内核在Apple GPU上矩阵乘最高约 3 倍加速;这些均为项目方给出的数字,未附第三方复现。

ggml同步更新至v0.26.0,新增缓冲区分配API、SYCL/Vulkan/Metal稀疏注意力内核以及多后端算子改动。

llama.cpp发布v0.6.0。根据项目发布说明,该版本新增llama_batch_ext扩展批处理API,加入GLM-5.3-Flash(GLM5-Next)与Clef决策模型支持,并推出面向决策模型的 /v1/systemone服务端接口。

新增llama_batch_ext扩展批处理API

版本说明称,新API由llama_batch_ext与llama_process() 组成,支持token与embedding混合批处理,并为MTP、deepstack模型提供逐token的“state”嵌入。相关配套包括llama-cpp.h中新增的llama_batch_ext_ptr及释放器;examples、推测解码、mtmd和server均已迁移到该API。

同批API变更还包括:新增llama_get_causal_attn(),会话格式版本提升至LLAMA_SESSION_VERSION 11与LLAMA_STATE_SEQ_VERSION 4;mtmd_get_memory_usage() 改为返回含image_max_tokens与use_non_causal的mtmd_memory_usage结构体。

  • 新API:llama_batch_ext、llama_process()、llama_process_type
  • 批处理同时接受embd与原始token
  • 会话与状态序列格式版本号提升

模型支持范围

发布说明列出本版新增或完善支持的模型:GLM-5.3-Flash(GLM5-Next),描述为 320B的KDA/DSA混合文本+视觉模型,含mHC与MoE;Clef决策模型,文本与视觉均支持,并已在server端支持视觉输入;Ling 3.0 VL归入BailingMoeV3架构;Nimble决策模型;LFM2.5-Encoder-230M/350M注册Lfm2BidirectionalForMaskedLM;重排模型新增classifier_pooling支持。

  • GLM-5.3-Flash(GLM5-Next):320B文本+视觉混合模型,官方描述
  • Clef:文本与视觉;server端新增视觉输入支持
  • Nimble决策模型;Ling 3.0 VL;LFM2.5-Encoder 230M/350M

服务端与界面变化

服务端新增 /v1/systemone决策模型接口,官方称其带有专用决策流水线,最初支持laya、julia-1、lev、openjev(含视觉)、kev,随后扩展至nimble。/v1/embeddings开始接受带类型的视觉/音频/视频内容输入,并对无效请求返回HTTP 400。GET /v1/models与GET /models新增architecture对象,用于报告模型的输入/输出模态。

Web UI方面,版本说明提到新的模型下载流水线、Hugging Face Hub数据层、模型显存适配估算和模型id语法解析;新增类型安全的API类型、fetch辅助函数与下载就绪的模型存储管线,以及共享的模型显示组件。当UI不由服务端提供时,会移除内置UI的service worker。

  • 新增 /v1/systemone:面向laya、julia-1、lev、openjev、kev、nimble等决策模型
  • GET /models报告模型输入/输出模态
  • Web UI:HF Hub数据层、下载流水线与显存适配估算

性能相关改动与官方给出的数字

项目方在发布说明中称,Qwen4Exp获得MTP推测解码支持,在DGX Spark上解码约 1.5 倍加速;Metal新增少量行MMA矩阵乘内核,用于推测解码与批处理解码,Apple GPU上矩阵乘最高约 3 倍加速。Vulkan新增针对量化K/V的稀疏flash attention,Metal新增面向F16 KV的tensor API flash attention内核。

推测解码方面还包括:为simple draft与MTP增加概率采样;修复截断后在温度大于 0 时n-gram草稿被拒的问题;在EOG处停止接受草稿token。上述加速数字均为项目发布说明中的陈述,未附第三方评测。

  • Qwen4Exp MTP推测解码:官方称DGX Spark上约 1.5 倍解码加速
  • Metal少量行MMA矩阵乘:官方称Apple GPU上最高约 3 倍矩阵乘加速
  • Vulkan量化K/V稀疏flash attention;Metal F16 KV flash attention

底层ggml与其他更新

ggml同步更新至v0.26.0,新增alloc_buffer_n/get_alloc_size_n缓冲区分配API,SYCL、Vulkan、Metal上的稀疏flash attention内核,以及lightning indexer的多项改进(分数内存减半、分块、MUSA支持)。CPU后端新增BF16算子与分块k-quant mul_mat;CUDA新增模型驱动的W4A4(NVFP4/MXFP4)mul_mat路径与MMVQ共享专家融合;Hexagon后端新增采样器和更多量化类型。

其他修复涉及KV cache恢复时旋转不匹配、恢复失败后的K/V与循环状态清理、融合qkv在K/V头尺寸不均时的张量切分,以及k-pool模型图重分配等问题。

  • ggml v0.26.0:新缓冲区分配API,多后端稀疏注意力内核
  • CPU新增BF16算子;CUDA新增W4A4 mul_mat路径
  • KV cache恢复与张量切分相关修复

信息来源

llama.cpp Releases原始来源