新版为SYCL后端新增对主机固定内存单次分配上限 2GB的限制,涉及为昇腾等设备优化内存管理。
阅读全文开源项目
关注开放的模型、工具与代码,找到值得动手的项目。
llama.cpp b10737发布:修复qwen4exp序列状态恢复与CUDA中止问题
新版本修复了Qwen4Exp的序列复制、块位置键控、多模态输入以及CUDA中止等缺陷,并为合成测试模型添加PLE以覆盖状态往返恢复。
阅读全文llama.cpp发布b10736:修复测试日志详细度并同步各平台二进制
修复test-llama-archs测试的日志详细度问题,并禁用部分平台构建(如macOS KleidiAI、openEuler)。
阅读全文llama.cpp b10734发布:为M5+/A19+启用Metal 4.0张量API
新版本将Metal语言版本提升至 4.0,从独立metallib加载张量API内核,面向Apple M5及以上芯片和A19系列设备。
llama.cpp发布b10733:升级CI缓存并更新各平台预编译包
最新版本将ggml-org/ccache-action升级到v1.2.24,同时更新了macOS、Linux、Windows等平台的预编译二进制文件,但openEuler和KleidiAI构建仍处于禁用状态。
llama.cpp b10731为Qwen4实验模型加入循环状态回滚,修复MTP投机解码性能回退
新版本为Qwen4实验分支增加循环状态回滚支持,修复MTP投机解码因整状态序列化到主机内存导致的性能损失;实测代码解码达 183 tok/s,散文达 144 tok/s。
llama.cpp b10730发布:优化Qwen3.8-Flash-Next提示处理性能提升约 9%
llama.cpp发布b10730版本,通过按切片求和索引器头部并移除冗余cont操作,提升了Qwen3.8-Flash-Next模型的提示处理速度,实测从 2170 t/s提升至 2366 t/s。
LiteLLM v1.99.0发布:新增模型弃用预警、Amazon Comprehend Medical支持及Valkey向量存储
LiteLLM v1.99.0为代理新增模型弃用预警端点,加入AWS Comprehend Medical透传与Valkey向量存储,并全面迁移管理UI到新组件库。
Langflow发布 1.11.6:修复MCP公共变量保留与stdio头暴露问题
该版本还回溯移植了安全性与正确性修复。
OpenAI Codex发布 0.152.0:Vim模式新增搜索,MCP支持包名和输出限制
新版本为终端界面和codex exec增加凭据刷新进度显示,默认关闭规划工具,并修复多项Vim与自动审批问题。
llama.cpp b10729发布:为M1 Ultra新增Metal fa-vec调优
新版本通过PR #28088 为M1 Ultra加入Metal后端fa-vec(flash attention向量化)调优,并调整了代码段位置以优化性能;同时提供面向macOS、Linux、Windows、Android等多个平台的预编译二进制。
llama.cpp b10728发布:CUDA闪存注意力引入XOR swizzle共享内存优化
新版本在CUDA后端为Flash Attention的K/V共享内存tiles加入XOR swizzle布局,并修复DGX Spark上的共享内存竞争问题,同时提供多平台二进制。
Google python-genai v2.21.0发布:files.download支持流式下载、新增webm视频理解等
新版本为files.download增加destination参数、支持audio/webm MIME类型、GEAP翻译配置及Interactions API视频理解功能
llama.cpp b10727发布:Metal后端新增量化类型concat支持
本次更新为Apple Metal后端加入量化类型的连接(concat)操作支持,并补充了各平台预编译二进制。
Claude Code发布v2.1.252:修复Mac上Bash命令失败等四个问题
Anthropic更新了Claude Code命令行工具,修复了Mac上Bash命令因任务目录移动或链接而失败、远程控制会话卡顿等问题。
llama.cpp b10726发布:针对大Batch提示词处理的IQ模型AVX2加速
该版本新增批量GEMM内核并优化IQ Panel解码布局,以提升大批次提示词处理速度,同时为所有主要平台提供预编译二进制。
llama.cpp b10724:碎片化KV缓存恢复提速数十倍,CUDA后端从25-63秒降至221-424毫秒
新版本批量处理非连续单元格的状态恢复,CPU与设备端路径均覆盖,并增加了回归测试。
llama.cpp b10723发布:针对Intel Xe-LP GPU优化量化路径,提升生成与预填充性能
新版本改进了OpenCL后端在Intel Xe-LP显卡上的Q4_K/Q5_K量化矩阵运算,通过调整tile和N_DST参数带来性能提升。
Open WebUI发布v0.11.3:修复分支聊天重载断开与数据库升级失败问题
该版本将无障碍模式扩展到菜单和模型选择器,修复了分支聊天在重载后失联、数据库升级半途失败、自定义字体未生效及OAuth断开按钮误显示等问题。
Open WebUI v0.11.2发布:新增请求过滤器,修复多项稳定性问题并包含安全更新
Open WebUI v0.11.2为文档预览增加缩略图导航,为过滤器新增request阶段,并修复了推理模型流式中断、跨实例停止失效等问题。官方建议生产环境尽快升级以应用安全修复。
Google发布gemini-cli v0.59.0-nightly,仅更新依赖
该夜间版本仅包含上游依赖更新,无新增功能或修复说明。
LiteLLM发布v1.99.0-rc.2,回移多项UI与Anthropic桥接修复
新版本镜像均用cosign签名,官方建议通过固定commit哈希校验公钥。
谷歌发布gemini-cli v0.59.0-nightly版本,附代码变更链接
该版本为 2026 年 8 月 30 日的每日构建,主要变更可通过官方Changelog链接查看。
Gemini CLI夜间版收紧工作区信任:受限模式下强制过滤MCP服务器
v0.59.0-nightly.20260829修复核心信任机制,未明确信任的工作区将默认拒绝执行。
OpenAI Python SDK v3.6.0发布:为Responses和Chat Completions增加compute_units用量字段
新版本同时在认证方面强化了X.509 workload identity集成的安全性。
Claude Code v2.1.251发布:新增模型切换钩子、前台子代理实时工具流,修复多项安全漏洞
该版本为Claude Code增加了PreModelSwitch和PostModelSwitch钩子事件,支持前台子代理工具调用的实时流式传输,并修复了符号链接穿越、路径遍历、日志泄漏等安全漏洞。
LangChain发布langchain.mcp Alpha预览:MCP服务器可直连create_agent
LangChain 1.4.0a2引入首个官方MCP适配器MCPAdapter,将任意MCP服务器转为LangChain工具,连接处理复用FastMCP,支持多服务器及新旧协议。
LiteLLM v1.100.0-dev.2发布:新增Gemini 3.5转录支持与多项成本计算修复
开发版新增Prometheus调用方身份配置、Gemini 3.5转录模型支持,并修复Cluade缓存计费、Bedrock rerank签名、Redis凭证等问题。
Google发布gemini-cli v0.59.0-nightly日常更新,仅包含代码变更
该nightly版本发布于 2026 年 8 月 28 日,页面未列出新增功能或修复说明。
Claude Code发布v2.1.250:修复Bug并提升稳定性
该版本仅包含错误修复和可靠性改进,未新增功能。