开源llama.cpp Releases·原文 2026年9月30日

llama.cpp b11262发布:AVX512-FP16上用f32累加f16点积

该版本由Adrien Gallouët提交的 #29545 实现,替代此前的 #29530,只改变AVX512-FP16路径上的累加精度,其余平台二进制照常发布。

AI解读:这次改动针对的是ggml里一个很底层的计算细节:在AVX512-FP16指令集上做f16点积时,把中间累加过程放到f32里完成,而不是用f16累加。好处是数值更稳,代价没有在发布说明里给出。

受影响的不是普通聊天用户,而是自己编译或部署llama.cpp的开发者,尤其是跑在支持AVX512-FP16的Intel/AMD CPU上的人。如果你用的是官方预编译包,这个版本照常下载,只是版本号往前走了一格。

发布说明里只写了一行标题和签名,没有基准测试、没有速度数字,也没有说明精度提升幅度。所以现在只能说“累加精度变了”,不能说“更快”或“更准了X%”——这些数据来源里没有。

llama.cpp发布b11262版本。根据发布说明,本次代码改动为ggml:在AVX512-FP16上以f32累加f16点积(accumulate f16 dot products in f32 on AVX512-FP16),对应PR #29545,取代此前的 #29530,提交者为Adrien Gallouët。

发布说明同时列出了b11262的预编译产物下载,覆盖macOS/iOS、Linux、Android、Windows以及UI包。其中macOS Apple Silicon的KleidiAI版本标注为DISABLED,openEuler相关产物同样标注为DISABLED。

除上述改动说明和下载清单外,发布说明未提供性能数据、精度对比或适用范围说明。

信息来源

llama.cpp Releases原始来源