llama.cpp发布b11081:测试工具可配置张量标准差,回滚检查改用NMSE
该版本集中修改test-llama-archs与test-recurrent-state-rollback两个测试程序,新增 --arch正则支持、未知参数报错和运行摘要,同时调整了合成测试数据与top-k稳定性逻辑。
AI解读:llama.cpp b11081是一个测试工具向的更新,主角不是推理性能,而是两个测试程序:test-llama-archs和test-recurrent-state-rollback。前者现在可以把张量数据的标准差(stdev)设为可配置项,后者在logits不匹配时改为报告并检查NMSE(归一化均方误差)。
对跑llama.cpp模型兼容性测试的人来说,这解决了两个具体麻烦:合成张量的数值分布以前写死,现在能按需调整;递归状态回滚的日志对比以前只看是否匹配,现在有NMSE这个连续指标来判断偏差大小,阈值由nmse_eps控制。
改动还包括test-llama-archs支持 --arch正则、遇到未知参数直接失败并打印用法、增加测试运行摘要,以及把Mamba的ssm_a初始化为负值。DSA索引器分数投影在合成fixture中被置零。这些都属于测试基础设施,普通用户升级二进制后使用方式不变。
llama.cpp发布b11081版本,仓库ggml-org/llama.cpp的release说明显示,本批改动集中在测试代码,提交标题为“test-llama-archs : make tensor data stdev configurable and improve help (#29133)”。
test-llama-archs的张量数据标准差(stdev)改为可配置。同一提交还展开用法说明并补充示例,遇到未知参数会失败并打印用法,同时新增测试运行摘要。
test-recurrent-state-rollback现在会在logits不匹配时报告NMSE,并把回滚logits检查从布尔匹配改为使用NMSE。相关阈值通过nmse_eps调整。
其他改动包括:Mamba的ssm_a初始化为负值;DSA索引器分数投影在合成测试fixture中置零;测试新增 --arch正则支持;调整了top-k稳定性逻辑并修正top-k取值;部分无效测试被禁用;日志输出统一格式。多个提交注明Assisted-by: pi:llama.cpp/DeepSeek-V4-Flash-Vision-Exp。
预编译包覆盖的平台
release页面同时列出了b11081的预编译产物,覆盖macOS、iOS、Linux、Android和Windows。Linux侧包括Ubuntu x64/arm64/s390x CPU、Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO 2026.4以及SYCL FP32/FP16。Windows侧包括CPU x64/arm64、OpenCL Adreno arm64、CUDA 12.4、CUDA 13.4、Vulkan、OpenVINO 2026.4、SYCL和ROCm 10.0。
- macOS:Apple Silicon arm64、Intel x64,以及iOS XCFramework。
- Linux:Ubuntu x64/arm64/s390x CPU,另有Vulkan、CUDA 12.8、CUDA 13.4、ROCm 10.0、OpenVINO 2026.4、SYCL FP32/FP16构建。
- Windows:CPU x64/arm64、OpenCL Adreno arm64、CUDA 12.4/13.4、Vulkan、OpenVINO 2026.4、SYCL、ROCm 10.0。
- Android:arm64 CPU包。
- openEuler下x86与aarch64(310p、910b ACL Graph)标注为DISABLED,macOS Apple Silicon的KleidiAI版本也标注DISABLED。