llama.cpp b11156发布:新增Ling 3.0 VL多模态模型支持
本次提交 (#29151) 将Ling 3.0 VL并入BailingMoeV3架构,并修复了mrope门控下共享NORM rope列表的完整性问题。
AI解读:llama.cpp的b11156版本加进了Ling 3.0 VL的支持,由提交 #29151 完成。这个模型不是单独写一套新架构,而是折进已有的BailingMoeV3里,意味着之前跑过该架构的设备基本能沿用同一套加载路径。
代码里还带了一个修复:在bailingmoe3根据mrope段做门控时,保留共享的NORM rope列表不被破坏。这类问题通常不影响文本模型,但会干扰多模态位置编码的稳定性,属于跑VL模型时才会碰到的坑。
真正受影响的是想用Ling 3.0 VL做本地推理的人:现在可以直接用预编译的llama.cpp跑,而不必自己改代码适配。但来源只给了提交标题和发布页,没有附跑分或最低显存说明,性能提升多少、完整支持哪些模态,都还没有公开数据可查。
llama.cpp释出b11156版本,主提交为“add Ling 3.0 VL support (#29151)”。
Ling 3.0 VL并入BailingMoeV3架构
提交 #29151 的改动说明为:将Ling 3.0 VL折叠进BailingMoeV3架构(fold Ling 3.0 VL into the BailingMoeV3 architecture),并注释“Assisted-by: Scout”,共同作者为aetherbird。
同一提交还包含一项修复:当bailingmoe3根据mrope段进行门控时,保持共享的NORM rope列表完整(keep shared NORM rope list intact when gating bailingmoe3 on mrope sections)。
- 主提交:#29151,标题add Ling 3.0 VL support
- 实现方式:并入现有BailingMoeV3架构,而非新增独立架构
- 附带修复:mrope段门控下共享NORM rope列表保持完整
- 共同作者:aetherbird;Assisted-by: Scout
b11156构建产物覆盖的平台
发布页按平台列出预编译产物。macOS/iOS提供Apple Silicon arm64、Intel x64和iOS XCFramework;其中macOS Apple Silicon(arm64,启用KleidiAI)一项在发布页标注为DISABLED,指向PR #23780。
Linux侧提供Ubuntu x64/arm64/s390x的CPU版本,以及Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16等后端;另有Linux arm64骁龙版本,支持CPU、Adreno GPU、Hexagon NPU,并附setup guide。
移动端提供Android arm64的CPU版与骁龙版(CPU、Adreno GPU、Hexagon NPU),Windows提供x64/arm64 CPU、arm64 OpenCL Adreno,以及CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0等Windows构建。openEuler相关的x86/aarch64与 310p、910b ACL Graph条目在发布页标注为DISABLED,指向PR #23705。另附UI打包文件。
- macOS Apple Silicon KleidiAI版标记为DISABLED,指向PR #23780
- openEuler全部条目标记为DISABLED,指向PR #23705
- Linux覆盖CUDA 12.8 / CUDA 13.4 / ROCm 10.0 / Vulkan / OpenVINO 2026.4 / SYCL
- Android与Windows arm64有骁龙OpenCL/Adreno等专用构建