llama.cpp发布b10896:修复DFlash视觉模型下mtmd chunk解码失败问题
llama.cpp新构建b10896修复了投机解码组件DFlash在搭配视觉模型时,mtmd chunk因图像固定偏移而无法解码的问题,并调整为仅跳过图像、允许音频通过。
AI解读:这次更新修的是llama.cpp投机解码里的一个具体bug:当DFlash搭配视觉模型使用时,drafter(推测解码的草稿模型)内存无法为新token分配空间,原因是图像上报的偏移量是固定的。修复方式是停止复制这些图像数据,让drafter能继续工作。
按PR反馈,修复把跳过M-RoPE的范围限制在图像上,音频可以正常通过。判断依据是发布说明里描述的补丁内容,原始issue和测试数据未在来源中给出。
受影响的是在llama.cpp上同时使用DFlash投机解码和视觉模型的用户,属于多模态推理路径上的修复。普通文本推理、不涉及DFlash或视觉输入的用户大概率不受影响,但来源只给出补丁说明,没有性能数字或回归测试细节。
llama.cpp发布构建版本b10896,修复了投机解码(speculative decoding)组件DFlash在搭配视觉模型使用时,mtmd chunk解码失败的问题。
根据发布说明,问题出在DFlash与视觉模型配合时,drafter内存无法为新token分配空间,原因是图像上报的是固定偏移量。修复方式是停止复制这些图像数据,让drafter继续运行。
按PR反馈,修复将M-RoPE跳过范围限制为仅图像,音频可以照常通过,同时对注释做了清理以对齐更新后的实现。
该版本提供macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework、Linux(Ubuntu x64/arm64/s390x,含CPU、Vulkan、ROCm 10.0、OpenVINO 2026.3.1、SYCL FP32/FP16构建)、Android arm64、Windows(CPU、CUDA 12.4、CUDA 13.3、Vulkan、OpenVINO、SYCL、ROCm 10.0等)以及UI下载包。openEuler构建和macOS Apple Silicon KleidiAI版本在本次发布中标为DISABLED。