llama.cpp发布b11102,新增MiMo-V2.6模型转换支持
该版本将K3 mxfp4转换重打包逻辑提升到base.py以便复用,从mmproj转换中移除decoder,并改用autoparser。
AI解读:llama.cpp的b11102版本给模型转换工具加上了MiMo-V2.6支持。提交信息里还顺手做了两件整理工作:把原先只服务于K3 mxfp4的转换重打包逻辑提升到base.py,好让其他模型也能复用;同时从mmproj转换中移除了decoder。
这改变的是模型转换脚本的覆盖范围,不是推理引擎本身的能力边界。对想把MiMo-V2.6跑在llama.cpp上的开发者来说,这是从“得自己动手改脚本”到“官方转换路径可用”的差别;但发布说明没有给出转换后的效果、支持哪些量化格式或性能数据,实际可用性还需要自己验证。
发布页同时列出了大量预编译二进制文件,覆盖macOS、iOS、Linux、Android和Windows,以及CPU、Vulkan、CUDA 12/13、ROCm 10.0、OpenVINO、SYCL等后端。这意味着不需要从源码编译就能拿到这个版本,但其中openEuler构建和启用KleidiAI的macOS Apple Silicon构建被标记为DISABLED。
llama.cpp发布b11102版本,主要变更是为模型转换工具添加MiMo-V2.6支持。
根据提交信息,该更新将K3 mxfp4转换重打包逻辑提升到base.py以便复用,并从mmproj转换中移除decoder;修复项包括改用autoparser。提交由Sigbjørn Skjæret和Piotr Wilkin共同参与。
发布页同时提供macOS、iOS、Linux、Android、Windows及openEuler平台的预编译产物,覆盖CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL等后端。
转换逻辑的三处调整
本次提交的核心是convert: add MiMo-V2.6 support,即为llama.cpp的模型转换流程增加MiMo-V2.6这一模型的转换支持。
配套改动包括:把K3 mxfp4转换重打包逻辑提升(hoist)到base.py,使其可被复用;从mmproj转换中移除decoder;以及将相关实现改为使用autoparser。
提交信息中未说明这些改动对转换后模型精度、速度或文件大小的影响。
平台与后端覆盖
发布页列出了b11102的预编译产物,按平台分类如下(均为发布页标注):
- macOS/iOS:macOS Apple Silicon(arm64)、macOS Intel(x64)、iOS XCFramework;其中KleidiAI启用的macOS Apple Silicon版本标注为DISABLED。
- Linux:Ubuntu x64/arm64/s390x(CPU)、Ubuntu x64/arm64(Vulkan)、Ubuntu x64(CUDA 12与CUDA 13)、Ubuntu x64(ROCm 10.0)、Ubuntu x64(OpenVINO 2026.4)、Ubuntu x64(SYCL FP32与FP16)、Linux arm64 Snapdragon(CPU、Adreno GPU、Hexagon NPU)。
- Android:Android arm64(CPU)、Android arm64 Snapdragon(CPU、Adreno GPU、Hexagon NPU)。
- Windows:x64/arm64(CPU)、arm64(OpenCL Adreno)、x64(CUDA 12.4与CUDA 13.4)、arm64(CUDA 13.4)、x64(Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0)。
- openEuler:x86 310p、x86 910b(ACL Graph)、aarch64 310p、aarch64 910b(ACL Graph)均标注为DISABLED。
- 另有UI打包文件(llama-b11102-ui.tar.gz)可供下载。