llama.cpp b11114修复服务器路由驱逐竞态:所有模型加载改走队列
llama.cpp发布b11114版本,服务器端修复了两个与路由驱逐和停止中模型相关的竞态问题,并继续提供覆盖macOS、Linux、Windows、Android等平台的预编译包。
llama.cpp发布b11114版本,服务器端修复了两个与路由驱逐和停止中模型相关的竞态问题,改动编号 #29217。
发布说明称,走“快速路径”加载的模型没有队列条目,tick() 会在它刚进入LOADED状态、自己的请求还没被代理出去时就把这个模型驱逐掉。
第二个问题是:请求会看到一个正在停止、仍处于LOADED的模型,并被代理进正在退出的子进程。
修复方式是让所有模型加载都经过队列,队列条目会保护模型直到它的等待者离开;同时不再把请求放进正在停止的模型,这类请求会加入队列并由下一个实例服务。
停止标记与UNLOADED在同一把锁下清除
发布说明提到,停止标记与UNLOADED状态在同一把锁下清除,因此当模型的子进程已经不存在时,不会有请求看到一个既不是stopping、也不是unloaded的模型状态。
本次发布同时列出了覆盖多个平台的预编译包。macOS/iOS方向包括Apple Silicon(arm64)、Intel(x64)以及iOS XCFramework;其中macOS Apple Silicon的KleidiAI版本标注为DISABLED。
- Linux侧提供Ubuntu x64/arm64/s390x(CPU),以及Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16等构建。
- 还包含Linux arm64的Snapdragon包(CPU、Adreno GPU、Hexagon NPU),配独立setup guide。
- Android提供arm64(CPU)和arm64 Snapdragon(CPU、Adreno GPU、Hexagon NPU)包。
- Windows提供x64/arm64(CPU)、arm64 OpenCL Adreno、CUDA 12.4/13.4、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0等构建。
- openEuler的x86与aarch64构建(310p、910b ACL Graph)标注为DISABLED。
- 发布页还提供UI包与attestations栏目。以上平台与构建信息依据发布说明摘要整理。