llama.cpp b10996发布:qwen3-coder推理预算耗尽时强制换行
llama.cpp新构建版本号为b10996,唯一功能变更是chat层面在qwen3-coder的reasoning budget结束时强制输出换行符,同时提供覆盖macOS、Linux、Windows、Android的预编译包。
AI解读:受影响的是用llama.cpp跑qwen3-coder并依赖推理预算控制输出长度的人。推理预算用尽通常意味着模型被截断,如果结束位置正好在句中,后续处理很容易把半句话当成完整内容;强制换行让截断点有一个明确的文本边界。
这类改动本身不提升模型能力,只改变输出格式的收尾行为。是否解决了实际问题、在什么条件下生效,发布说明没有展开,需要用户在自己场景里验证。同时b10996的预编译包已覆盖macOS、Linux、Windows、Android多个后端,按平台下载即可。
llama.cpp发布构建版本b10996,发布说明中列出的唯一功能变更是:在qwen3-coder的reasoning budget(推理预算)结束时,chat层强制输出 `\n `(换行符),对应PR #28869。
发布页同时提供该版本的预编译产物,覆盖macOS(Apple Silicon arm64、Intel x64)、iOS XCFramework、Linux(Ubuntu x64/arm64/s390x,含Vulkan、CUDA 12.8、CUDA 13.3、ROCm 10.0、OpenVINO 2026.3.1、SYCL FP32/FP16等后端)、Android arm64、Windows(CPU、OpenCL Adreno、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0)以及UI包。
发布页显示macOS Apple Silicon的KleidiAI版本处于DISABLED状态(指向PR #23780),openEuler相关构建同样标记为DISABLED(指向PR #23705)。
PR #28869 改了什么
发布说明原文为“chat : force `\n ` on reasoning budget end for qwen3-coder (#28869)”,即针对qwen3-coder,在推理预算结束时由chat层强制写入换行。
这是b10996发布说明中唯一列出的功能性改动;发布页未提供该行为变更的测试结果、生效条件细节或效果数据。
- 变更对象:qwen3-coder
- 触发条件:reasoning budget结束
- 行为:强制输出 `\n `
- 对应PR:#28869
各平台预编译包
该版本按平台提供二进制包,发布页列出macOS Apple Silicon arm64、macOS Intel x64、iOS XCFramework,Linux的Ubuntu x64/arm64/s390x及Vulkan、CUDA 12.8、CUDA 13.3、ROCm 10.0、OpenVINO 2026.3.1、SYCL FP32/FP16构建,Android arm64,以及Windows的CPU、OpenCL Adreno、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0构建。
CUDA构建同时单独提供对应的运行时库包(CUDA 12.8、CUDA 13.3、CUDA 12.4、CUDA 13.4)。
发布页列出macOApple Silicon的KleidiAI enabled版本和openEuler构建为DISABLED,并分别给出对应PR编号。
- macOS/iOS:arm64、Intel x64、iOS XCFramework
- Linux:Ubuntu x64/arm64/s390x,Vulkan、CUDA 12.8/13.3、ROCm 10.0、OpenVINO 2026.3.1、SYCL FP32/FP16
- Android:arm64(CPU)
- Windows:CPU x64/arm64、OpenCL Adreno、CUDA 12.4/13.4、Vulkan、OpenVINO、SYCL、ROCm 10.0
- 另有独立UI包