
AWS博客详细介绍如何在CI/CD流水线中自动部署智能体、调用评估API,并在评分下降时阻止PR合并。
阅读全文关注开放的模型、工具与代码,找到值得动手的项目。

AWS博客详细介绍如何在CI/CD流水线中自动部署智能体、调用评估API,并在评分下降时阻止PR合并。
阅读全文llama.cpp发布b10865版本,代码层面仅包含一个revert,回退了此前在HIP构建中恢复prop.integrated的提交;同步提供多平台二进制与UI包。
阅读全文新版本调整检查点淘汰逻辑:间距淘汰仅在检查点列表写满时生效,并改为在同n_tokens位置替换而非追加重复项,避免恢复时从头重算。
阅读全文Multiverse Computing的新论文不再按“主题”一刀切拒答,而是聚焦“主题内子集”边界。在政治操纵场景下,新方法使良性侧过拒从 32.94% 降至 4.16%,有害侧拒答仅小幅回落;研究同时警示,单纯提高拒答率可能带来严重的过拒问题。
新版本修复GPT-5推理努力级别配置,并针对OpenAI 3.8调整Azure AD认证。
新版修复了Metal后端在特定矩阵乘法操作中的线程调度缺陷,同时提供多平台预编译二进制供下载。
新版本解决在特定构建环境下因缺少头文件导致的编译失败问题,共涉及至少 6 个bug修复。
新版将GELU、SIGMOID、SILU、SOFTPLUS与MUL融合为单一Vulkan内核,针对gemma4、qwen3next等架构的共享专家门控,修复 10-18% 的预填充性能回退。
llama.cpp发布b10857版本,修复Vulkan-Hpp在 32 位目标上的句柄使用问题,并同步提供各平台预编译二进制。
llama.cpp发布b10856版本,将 14 个专用模板解析器从chat.cpp拆分为独立文件,chat.cpp代码行数降至 1513 行,无功能变化。
新版本主要修复OpenCL后端conv2d对非连续输入的stride处理问题,并同步更新各平台预编译包。
llama.cpp发布b10853版本,核心变更为支持Kimi-K3模型的循环状态回滚功能。
新版本主要为Qualcomm Hexagon后端补齐两种激活函数算子,涉及代码合并(PR #28585)。
新版本仅包含一项测试代码修复,将L2_NORM批次数绑定到局部变量并为数组初始化,解决aarch64 Release构建在GCC 12下因“可能未初始化”告警导致的编译失败。
Vulkan成为最后一个为DeepSeek-V4添加融合算子(DSV4_HC_COMB/PRE/POST)的主要后端,此前在Strix Halo上未融合的Sinkhorn链约占解码操作时间的 32%。
新版本为ggml添加面向AMD gfx90c平台的HIP后端并使其符合规范,同时更新了多个平台的预编译二进制。
新版本针对批大小大于 1 的mmvq场景优化,将Q4_K/Q5_K解包改为无分支计算,避免每列重复执行缩放解包;同时为NVIDIA DGX Spark加入L2预取支持。
llama.cpp发布b10839,修复Vulkan后端因张量偏移未对齐导致GET_ROWS运算断言失败的问题,该问题影响Qwen3-TTS和Qwen3-VL等模型。
10 月 16-17 日,GOSIM Shenzhen 2026将在深圳南山伊敦酒店举办,设 6 大技术主题论坛、7 场Workshop、4 场Hackathon和Spotlight路演,早鸟票 9 月 17 日截止。
本次更新包含一项针对type内容处理的重检修复。
本次更新包含两个ggml-cuda补丁:修复f16 flash attention中的divergent barrier问题,并避免重复的元数据指针设置。修复主要影响NVIDIA GPU上使用半精度Flash Attention的场景。
本次更新允许ggml后端输入不创建另一个split,并更新了各平台构建产物。
llama.cpp发布b10833,为Vulkan后端新增RMS_NORM与MUL、ADD、VIEW、SET_ROWS等操作的融合支持,并扩展ROPE对IMROPE的支持,作者称在其系统上Gemma模型性能提升约 4%。
新版本在Vulkan后端加入TQ1_0量化格式的矩阵乘法、矩阵向量乘等内核,并将 3 的幂打包进 32 位常量以优化实现。
MiniCPM5-2B在Artificial Analysis Intelligence Index v4.2上得15分,超越Granite 4.2 3B(11分),但落后于Ling 3.0 Tiny(16分)。

llama.cpp发布b10830版本,核心变化是在HF到GGUF转换工具中新增 --fuse-qkv参数,可在模型转换阶段将查询、键、值矩阵融合为QKV。各平台安装包同步发布。
此修复改变了GDN q/k归一化的epsilon处理方式,影响Qwen3-Next等模型的数值行为,cuda、vulkan等预编译二进制已同步更新。
llama.cpp发布b10828版本,新增对Spark2_5ForCausalLM模型实现的支持,并同步提供各平台预编译二进制下载。
新版本包含一项OpenCL修复,涉及q4_K与q5_K量化格式在矩阵乘法中的权重打包逻辑,同时为各平台提供预编译二进制。
新版本主要针对CUDA后端的多模态推理(如mmid、mmf)进行并发修复,并同步更新各平台预编译二进制文件。