llama.cpp b11025发布:扩展Nemotron MTP支持
构建编号b11025的发布说明显示,本次改动主题为扩展Nemotron MTP支持(PR #29018),同时照例提供覆盖macOS、Linux、Windows、Android等平台的预编译二进制包。
AI解读:这条发布最核心的信息是一个功能改动:llama.cpp扩展了对Nemotron MTP的支持,对应PR #29018,提交说明里还提到做了第一轮修复、删除了不必要的声明。
它解决的是推理端对Nemotron系列模型MTP能力适配不完整的问题,受影响的主要是把Nemotron跑在llama.cpp上的开发者,而不是普通聊天用户。除此之外,这仍是一次例行构建发布,各平台二进制包照常更新。
需要注意,发布说明只列出了改动标题和零散的提交要点,MTP支持具体扩展到什么程度、支持哪些模型规格、性能如何,来源里都没有给出,因此现在能确认的仅是“改动已并入这个构建”。
同一版本还出现了若干被标记DISABLED的构建项,例如macOS Apple Silicon的KleidiAI版本和openEuler相关产物,想用这些平台特定加速的人在下手前要先确认对应包是否可用。
llama.cpp发布构建b11025,发布说明中列出的主要改动是扩展Nemotron MTP支持,对应PR #29018。
该改动的提交要点为“first fix”和删除不必要的声明,说明这是一次针对既有MTP支持的修补与扩展,而非全新功能模块。
除代码改动外,本次发布照例提供了各平台的预编译二进制文件,覆盖macOS、iOS、Linux、Android、Windows以及UI包。
发布说明仅给出改动标题与提交要点,未说明MTP扩展所涉及的模型版本、量化格式或性能数据,具体适用范围需以代码合并内容为准。
Nemotron MTP支持扩展开关:PR #29018
b11025的发布说明首行标注“model : extend Nemotron MTP support (#29018)”,即该构建的主要变更是扩展Nemotron的MTP支持。
提交要点包含“first fix”与“removed unnecessary declarations”,说明改动里既有初步修复,也清理了一些多余的声明。
来源没有说明这次扩展具体支持哪些Nemotron变体、MTP层数或推理参数,也未提供吞吐、延迟等对比数据。
- 改动标识:model : extend Nemotron MTP support (#29018)
- 提交要点:first fix;移除不必要的声明
- 来源未给出:支持的模型规格、性能变化、兼容性细节
预编译产物覆盖范围与禁用项
本次发布仍按平台提供二进制包:macOS有Apple Silicon arm64和Intel x64版本,另有iOS XCFramework。
Linux侧包含Ubuntu x64、arm64、s390x的CPU包,以及Vulkan、CUDA 12.8、CUDA 13.3、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16等加速版本。
Windows侧包含x64与arm64的CPU包、arm64的OpenCL Adreno包,以及CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0等版本;Android提供arm64 CPU包。
发布说明同时列出被禁用的条目:macOS Apple Silicon的KleidiAI启用版标注为DISABLED,并关联PR #23780;openEuler各产物同样标注DISABLED,关联PR #23705。
- macOS/iOS:Apple Silicon arm64、Intel x64、iOS XCFramework;KleidiAI版本DISABLED(PR #23780)
- Linux:Ubuntu x64/arm64/s390x CPU,Vulkan,CUDA 12.8、13.3,ROCm 10.0,OpenVINO 2026.4,SYCL FP32/FP16
- Windows:x64/arm64 CPU,OpenCL Adreno arm64,CUDA 12.4、13.4,Vulkan,OpenVINO,SYCL,ROCm 10.0
- Android:arm64 CPU
- 禁用:openEuler(x86/aarch64的 310p、910b ACL Graph)DISABLED(PR #23705)
- 另有UI包单独提供