llama.cpp b11060修复Mamba时间步投影输入连续性
该版本将Mamba时间步投影的输入改为连续内存,并在归一化后跳过连续拷贝;发布页同时提供macOS、Linux、Windows、Android等多平台预编译包。
AI解读:llama.cpp发布b11060版本,核心改动只有一处:在Mamba实现中把时间步投影(time-step projection)的输入变为连续内存。
改动的直接收益是避开非连续张量在后续算子中的额外处理,同时第二个提交让归一化之后不再做一次连续拷贝,减少一次内存搬运。
发布页照例给出各平台预编译包,覆盖macOS、iOS、Linux、Windows、Android,以及CUDA、Vulkan、ROCm、SYCL、OpenVINO等后端;跑Mamba架构模型的人可以按平台直接更新。
llama.cpp发布b11060版本,合并的改动为“fix(mamba) : make time-step projection input contiguous (#28832)”。
该提交包含两条修改:将Mamba的时间步投影输入变为连续(contiguous)内存;在归一化之后跳过连续拷贝。提交信息注明Assisted-by: ChatGPT。
发布页同版本提供多平台预编译产物,包括macOS Apple Silicon(arm64)与macOS Intel(x64)、iOS XCFramework、Ubuntu x64/arm64/s390x(CPU),以及Ubuntu的Vulkan、CUDA 12、CUDA 13、ROCm 10.0、OpenVINO、SYCL FP32/FP16版本。
Windows侧提供CPU(x64、arm64)、OpenCL Adreno(arm64)、CUDA 12.4、CUDA 13.4(x64与arm64)、Vulkan、OpenVINO、SYCL、ROCm 10.0构建;Android提供arm64 CPU包。
发布页显示openEuler构建为DISABLED;macOS Apple Silicon的KleidiAI enabled构建同样标注DISABLED,并链接到PR #23780。
该发布同时附带UI包(llama-b11060-ui.tar.gz)以及各CUDA版本对应的运行库压缩包。