9月2日李飞飞旗下World Labs发布多模态世界模型Atlas;国内空间智能团队影溯称其3月已开源具备类似能力的InSpatio-World,升级版即将发布,且其另一模型InSpatio-Curious在WorldArena 2.0榜单登顶。
阅读全文开源项目
关注开放的模型、工具与代码,找到值得动手的项目。
llama.cpp发布b10796:修复MoE分层专家数校验,支持变专家层模型加载
新版本引入n_expert_used_max函数,解决每层专家数不同导致的加载失败与断言错误,影响含Nemotron-3-Puzzle等分层MoE架构的模型。
阅读全文llama.cpp b10795发布:SYCL后端融合rms_norm+mul+add与add+add残差链
新版本在GGML_SYCL_ENABLE_FUSION下合并多个算子,减少内核启动次数;同时提供多平台预编译二进制。
阅读全文llama.cpp发布b10794:重构SYCL的MKL快速路径开关为全局变量
新版本将GGML_SYCL_ENABLE_MKL_FA改为全局变量,并提供多平台预编译二进制,macOS KleidiAI与openEuler构建暂被禁用。
gemini-cli夜间版v0.60.0发布:移除硬编码CrUX API密钥,强化MCP OAuth与扩展加载器安全
本次更新修复了macOS沙箱临时目录隔离问题,并在chrome-devtools-mcp中移除了硬编码的Google CrUX API密钥。
OpenAI Codex发布 0.154.0-alpha.3版本
开源CLI工具Codex发布新alpha版本,主要包含功能更新与修复。
LiteLLM v1.101.0-dev.2发布:新增按用户消费告警、密码策略与MCP语义工具搜索
该开发版为AI网关引入多项功能:Slack按用户消费阈值告警、可配置密码策略和仅SSO登录、MCP语义工具搜索,并统一修复Azure、Bedrock等多provider兼容问题。
OpenAI Codex 0.153.2发布:修正GPT-6-Astra快速档描述文字
新版本仅更改界面显示文本,将GPT-6-Astra Fast档描述从“1.5x速度”更正为“2x速度、用量增加”,不改变实际请求运行方式。
Claude Code v2.1.260发布:新增 /diff面板、修复多项权限与沙箱问题
Anthropic发布Claude Code v2.1.260,新增全屏模式下的 /diff面板,并修复包括权限规则、Bash沙箱、提示词缓存、模型切换等大量缺陷。
llama.cpp发布b10793:修复每次提交触发全量源码重建问题
新版本针对构建系统修复了整棵源码树在每次新提交后都会被强制重新编译的问题,并同步更新了各平台的预编译二进制。
OpenAI Codex发布 0.154.0-alpha.2版本
GitHub上的codex Releases页面发布了 0.154.0-alpha.2版本,由github-actions[bot] 自动发布。
llama.cpp发布b10792,修复空对象JSON Schema的GBNF语法生成
本次更新包含一个提交,其修复了结构化输出中对空JavaScript对象模式的GBNF语法生成问题。
OpenAI Codex 0.153.1发布:支持通过API配置GPT-6-Astra,不更改默认模型
本次更新将GPT-6-Astra模型目录向后移植到 0.153 版本,允许开发者在API中配置该模型,但不会改变默认模型或在模型选择器中显示。
llama.cpp b10791发布:OpenCL后端量化lm_head、解码GEMV及中批量GEMM优化
该版本针对OpenCL后端进行了多项性能优化,涵盖量化lm_head、解码GEMV和中批量GEMM,并包含特定硬件(如Adreno GPU)的调度与正确性修复。
llama.cpp b10790发布:调整SM87架构的MMVQ与MMQ切换阈值
新版本唯一变更针对SM87(推测为NVIDIA Blackwell架构)内核,调整了矩阵乘法向量量化(MMVQ)与矩阵乘法量化(MMQ)之间的交叉切换条件,未涉及其他功能更新。
OpenAI Python SDK v3.8.0发布:新增gpt-6-astra及相关API支持
新版本还补充了SDK安全模型的正式文档,发布日期为 2026 年 9 月 3 日。
微软发布Semantic Kernel .NET 1.80.1,移除已退役OpenAI Assistants集成测试
该补丁版将包版本升至 1.80.1,SDK更新至 10.0.303,并清理了与已退役OpenAI Assistants相关的测试与配置文件。
LangChain发布 1.4.0:新增langchain.mcp命名空间与MCPAdapter
新版本引入langchain.mcp模块和MCPAdapter,为Agent提供工具路由的模型目的地修复,并优化Anthropic中间件追踪性能。
GitHub Copilot应用支持并行运行多个AI代理,每个代理独立会话与Git工作树
GitHub官方博客发布面向初学者的指南,介绍如何在Copilot应用中同时运行多个代理会话,互不干扰且各自保留上下文。

LangChain发布langchain-anthropic 1.7.1,增加Claude Fable 5.1支持
新版本还优化了中间件追踪性能,可省略追踪输入以降低开销。
H Company发布NeoMME:单Transformer多模态编码器,260M参数检索性能优于同规模模型
NeoMME以单一双向Transformer直接处理文本和图像,无需预训练视觉塔与因果语言模型。其260M检索模型在保持51页/秒(2048×2048)编码速度的同时,以Apache 2.0许可开源。
llama.cpp发布b10786:为mtmd预处理类添加const限定
新版本包含一个代码改动mtmd: propagate const to preproc class,并为多平台提供预编译二进制,包括Linux、Windows、macOS、Android与iOS。
llama.cpp b10785发布:Metal后端新增稀疏Flash Attention,prefill阶段默认启用
该版本在Metal后端为Flash Attention加入稀疏掩码支持,通过索引压缩与单遍扫描降低掩码内存访问,并将稀疏路径用于prefill。
llama.cpp b10784发布:修复Metal后端GLU调度在ne00=1 时的错误
llama.cpp发布b10784版本,修复Metal后端在ne00=1 条件下的GLU调度问题,并同步提供多平台预编译二进制。
llama.cpp b10783发布,为mtmd多模态API增加const限定以支持多线程分词
该版本将mtmd_context与分词输入指针标记为const,使编译器能确认mtmd_tokenize可从多线程安全调用,同时面向多平台提供二进制包。
llama.cpp b10782发布:修复多GPU下CUDA图优化被跳过的问题
新版本允许每个设备分片独立启用CUDA图优化,并修复了CUDA事件绑定到错误GPU的问题;默认行为不变,仅在GGML_CUDA_GRAPH_OPT=1 时生效。
llama.cpp两日更新覆盖多模态、推理与硬件后端
9 月 2 日至 3 日的连续构建加入Nemotron-3-Puzzle支持,并修正DeepSeek-V4视觉、Qwen3 TTS、Vulkan、CUDA与Metal路径。
llama.cpp b10780发布:SYCL后端API增强,支持设备间对等复制
新版构建提供Ubuntu、Windows、macOS、Android与iOS等平台二进制,并默认应用KleidiAI优化。
OpenAI Codex发布 0.154.0-alpha.1版本
该版本以alpha形式发布,主要面向测试用户,包含多项更新。
llama.cpp b10778发布:修复模型加载阶段内存峰值问题
ggml-org发布llama.cpp b10778,主要变化是阻止模型加载时的RAM峰值(PR #27483),并同步提供多平台二进制包。