新版本在NUM_COLS > 4 时启用更高效的IQ3_S矩阵-向量kernel,n=8 批大小下性能提升达 5 倍。
阅读全文开源项目
关注开放的模型、工具与代码,找到值得动手的项目。
llama.cpp b10756发布:Vulkan后端仅在支持时请求BF16扩展
llama.cpp b10756发布,改进Vulkan后端对bfloat16扩展的兼容性处理,并更新多平台二进制包,涉及macOS、Linux、Windows、Android和iOS。
阅读全文llama.cpp b10754发布:修复Adreno OpenCL图像内核越界读取
llama.cpp发布b10754版本,修复了Adreno图像内核中的越界读取问题,并改进KQ/KQV GEMM的调度逻辑。
阅读全文LiteLLM发布v1.99.1:仅提供Docker镜像,修复OpenTelemetry缓存令牌计数
LiteLLM v1.99.1是仅镜像发布,无PyPI包,修复了OpenTelemetry v2缺少缓存令牌计数的问题。
LiteLLM发布v1.97.1:仅容器镜像更新,修复已知CVE
LiteLLM v1.97.1仅发布Docker镜像,未发布PyPI包;该版本刷新了基础镜像和依赖项固定版本以修复已知CVE,未改变LiteLLM行为。
llama.cpp发布b10753:为Hexagon后端补齐cpy/get_rows/set_rows/gdn算子的FARF日志
该版本修复了proc_op_req日志中ne[2] 打印错误,并为cpy、get_rows、set_rows、gdn算子新增形状与VTCM的FARF日志,同时提供多平台二进制包。
LangChain 1.4.0a4继续完善MCP适配层
第四个alpha版本调整MCP客户端组、工具转换、缓存和elicitation中断路由,仍属于预发布版本。
OpenAI Codex发布 0.153.0-alpha.5版本
这是Codex CLI的一个预发布版本,属于alpha分支的迭代更新。
OpenAI Python SDK发布v3.7.0:更新用量API文档并优化embedding的numpy检查
新版本更新了usage APIs及相关文档,并修复了embedding处理中重复numpy检查的问题。
谷歌发布gemini-cli 0.59.0夜间版,改进网页抓取工具的目的地验证与连接路由
本次更新由首次贡献者diegogodinezr提交,核心修复针对网页抓取工具中目的地验证和连接路由。
llama.cpp b10752发布:为XCFramework增加metallib构建支持
更新聚焦Metal后端构建,使iOS XCFramework可包含预编译metallib,并同步更新多平台二进制与预编译包。
Ollama 0.33.3修正GGUF默认参数处理
新版本会遵循GGUF模型文件声明的默认参数,并同步更新MLX、MLX-C与llama.cpp依赖。
Claude Code v2.1.258修复macOS 12启动失败及远程/定时会话报错
针对 2.1.255 引入的回归问题,Claude Code发布补丁修复macOS Monterey启动失败和远程/定时会话权限审批错误。
OpenAI Codex发布v0.152.1:修复Node REPL策略未生效问题
Guardian审批审查现在会遵循通过模型元数据提供的Node REPL策略。
LiteLLM v1.101.0-dev.1:新增Claude Fable 5.1、GLM-5.3定价及工作负载身份联合支持
LiteLLM发布v1.101.0-dev.1开发版,新增Claude Fable 5.1模型支持、Qwen平台别名、GigaChat原生直通、分时非高峰定价,并推出OpenID连接工作负载身份联合,还修复了多项代理与模型路由问题。
Langflow 1.12.0发布,强化RBAC、SSO、可观测性与安全
新版本为模型提供商引入治理与审批策略,支持将遥测导出到任意OTLP后端,并加大了对代码执行沙箱和密钥保护等安全机制的投入。
Google发布gemini-cli v0.58.0:修复符号链接、隔离macOS Docker套接字等
更新包含 6 项修复与重构,重点改进沙箱安全性、忽略路径处理和A2A服务器错误处理。
Google发布gemini-cli v0.59.0-preview.0,修复MCP安全漏洞并加强工作区信任限制
新版本修复了MCP OAuth元数据发现与认证过程中的SSRF风险,并在受限模式下强制执行工作区信任和mcpServers过滤。
llama.cpp b10751发布:CUDA端融合MoE加权专家归约,减少显存中间流量
llama.cpp发布b10751版本,核心改动是在CUDA后端将MoE组合尾部的加权专家输出写入全局内存再归约的过程,融合为单个加权归约内核,以降低显存带宽开销。
llama.cpp b10750:KV缓存n-gram查找改用序列位置索引,生成速度提升约 5%
新版本通过复用序列位置索引避免在每个ubatch重建哈希表,使解码速度从 ~69.3 t/s升至 72.7 t/s(+4.9%),预填充保持不变,贪心输出结果一致。
llama.cpp b10749发布:指定YaRN缩放时自动调整训练上下文长度
该版本通过PR #28030 实现上下文的自动缩放,并同步更新了各平台的预编译二进制文件。
llama.cpp发布b10743:为M2 Pro新增Metal fa-vec调优
该版本主要更新了Metal后端对M2 Pro芯片的fa-vec调优,并补充了新的数据类型支持。
Claude Code v2.1.257发布:默认Fable模型升级为 5.1,新增时间格式与自动模式外读防护
Anthropic于 2025 年 5 月 9 日发布Claude Code v2.1.257。本次更新将默认Fable模型切换为Claude Fable 5.1,支持 1M上下文,定价 $10/$50 每百万token;新增timeFormat/timeZone设置、自动模式下的“Containment Escape”规则,以及大量针对子代理、后台会话、网关和VSCode扩展的修复。
Anthropic Python SDK发布v1.3.0:更新用户资料API,修复AWS与批处理响应解析
新增beta用户资料字段、组织合规设置与schema更新;修复skip_auth场景下AWS base_url解析及批处理GA响应包装器缺少结果的问题。
LangChain发布 1.4.0 第三个alpha:新增langchain.mcp命名空间,用于将MCP服务器适配为工具
MCPAdapter可接入URL、本地脚本或进程内服务器等多种目标,并支持缓存与人工中断提示。
llama.cpp b10742发布:为A18 Pro芯片加入fa-vec调优
新版llama.cpp为搭载A18 Pro的MacBook Neo添加Metal后端fa-vec调优,同时照常提供各平台二进制包。
llama.cpp发布b10741:修复n_layer初始化顺序问题
新版本调整了模型加载时hparams.n_layer_nextn的读取顺序,避免在n_layer() 调用前未初始化的问题,并为多平台提供预编译二进制。
llama.cpp b10740发布:修复Metal后端的自动释放池缺失导致的内存泄漏
该版本通过补充缺失的autoreleasepool和相关变量重命名,修补了macOS/iOS上Metal后端的内存泄漏问题。
llama.cpp发布b10739:为M2 Max添加fa-vec调优数据
新版本通过 'ggml-metal-tuning fa-vec' 采集的M2 Max(30 GPU核心)数据优化Metal后端向量查找性能,并同步提供多平台二进制包。
llama.cpp b10738发布:SYCL后端限制host-pinned内存分配不超 2GB
新版为SYCL后端新增对主机固定内存单次分配上限 2GB的限制,涉及为昇腾等设备优化内存管理。