OpenAI称其自研推理芯片Jalapeño在速度和能效上达到行业领先水平,专为现代模型设计,提供更高吞吐量和更低延迟。
阅读全文产品更新
从新功能到新体验,发现 AI 正在怎样进入日常。
Sierra在首尔设立办公室,进军韩国企业AI客服市场
Sierra联合创始人宣布在首尔开设办公室,该公司称其AI代理已覆盖全球三分之一主要银行和40%的财富50强企业。
阅读全文Gradio推出gr.Workflow:可视化拖拽搭建AI流水线,自动生成REST API
Hugging Face在Gradio中内置gr.Workflow,将多步骤AI流水线变为可拖拽画布,支持并行执行、GPU调用,并自动生成REST API。
阅读全文OpenWiki 0.4.0引入自纠错记忆机制,通过证据版本追踪减少文档过期与幻觉
LangChain团队为开源知识库工具OpenWiki推出基于代码证据的声明追踪系统,可将过期声明比例从 3.5% 降至 0.5%,并消除幻觉内容。

LangChain发布eval-engineering技能:以“世界规格”驱动合成Agent任务生成
LangChain详细介绍其内部构建合成Agent评测环境与任务的两阶段流程,并更新了eval-engineering技能,帮助团队从生产trace中持续生成评测基准。

LangSmith Engine更新:问题检测能力翻倍,新增Slack与Linear集成
LangChain宣布其代理分析工具LangSmith Engine自5月发布以来性能大幅提升,现已在自托管部署中可用,并支持Slack和Linear工作流集成。

OpenAI为ChatGPT Work和Codex推出Admin插件,支持用量分析与权限管理
OpenAI发布Admin插件,管理员可借此分析工作区使用情况、管理成员与权限、调整限额并处理管理请求。
Google Antigravity智能体新增交互式UI技能:开发者通过模态框选择而非文字提示配置工作流
Google开发者关系工程师James O'Reilly发布Antigravity智能体技能编写指南第一部分,介绍如何通过嵌入ask_question工具的UI模态框和JSON状态持久化,将智能体从文本解析器转变为结构化交互面试官。

LLM的Anthropic插件发布 0.27 版,适配anthropic v1.0.0库的httpx2迁移
llm-anthropic 0.27主要解决与anthropic v1.0.0 Python库的兼容性,后者从httpx切换到httpx2。
AI生成代码增多,代码验证为何成为新瓶颈
Sonar CTO Andrea Malagodi与Google DORA、METR等研究均显示:AI让写代码变快,但验证负担大增,现有静态分析、测试、人工审查组成的“过滤器栈”正面临数量与安全漏洞双重压力。

NVIDIA声称Spectrum-X以太网可将AI训练性能提升并抵御多租户干扰
NVIDIA技术博客发文,详述其Spectrum-X以太网架构如何针对大规模AI训练优化,声称相比传统以太网,在性能、故障恢复和多租户隔离方面均有显著提升。

NVIDIA发布NVLink Fusion,将定制XPU接入其AI工厂基础设施
NVIDIA推出NVLink Fusion,允许超大规模企业和AI原生公司的定制XPU接入其NVLink互联域、MGX机架架构和软件栈,宣称可降低开发成本并加快上市时间。

NVIDIA宣布Groq 3 LPX全面投产,扩展Vera Rubin推理平台以支持智能体工作负载
在Hot Chips大会上,NVIDIA宣布Groq 3 LPX全面投产,并公布了合作伙伴采用情况及新的网络基础设施技术。

NVIDIA Vera Rubin NVL72声称在Agentic AI推理中每兆瓦吞吐量提升 30 倍
NVIDIA发布的Vera Rubin NVL72预览结果基于SemiAnalysis AgentX基准测试,显示其相对于GB300 NVL72,在每兆瓦AI工厂吞吐量上最高提升 30 倍,同时GB300 NVL72相比H200 NVL8在类似动态工作负载下的每兆瓦吞吐量优势最高达 15 倍。

NVIDIA发布Groq 3 LPX推理加速器:第三方基准显示 100K上下文下每秒生成 3431 个token
在Vera Rubin平台上,Groq 3 LPX通过编译器调度的确定性执行,实现了长上下文下的高交互性推理,第三方评测显示其速度可达每秒 3431 个输出token。

NVIDIA称Vera CPU可提升AI智能体任务性能达1.5倍,针对高变异性工作负载优化
NVIDIA发布技术文章,基于16万余次智能体会话遥测数据,称其Vera CPU在智能体任务上性能可达竞品AMD Venice的1.5倍。

NVIDIA发布BlueField-4 DPU,为智能体AI工厂提供横向扩展网络基础设施
NVIDIA技术博客宣布BlueField-4,旨在满足智能体AI工厂对多太比特带宽和专用DPU处理的需求。
NVIDIA发布DSX MaxLPS:动态功率分配与45°C液冷,称可在固定电力预算内多部署40% Rubin GPU
NVIDIA技术博客6月4日介绍了面向AI工厂的DSX MaxLPS,包含动态功率分配软件DPS、工作负载功率配置文件和45°C液冷设计,目标是在固定站点电力预算内提高每瓦特AI吞吐量。

OpenAI在Kiro中推出GPT-5.6,宣称提升开发者价格性能比
GPT-5.6现已集成至OpenAI的代码开发环境Kiro,官方称其在帮助开发者规划、构建、审查和测试软件时具备更优价格性能。
Midjourney发布 8/20/26 更新:修复Alpha站点性能与交互问题,恢复Upscale与Zoom功能
新版Alpha界面在两周测试后迎来大量修复,包括文件夹管理、设置持久化、图像处理按钮恢复等。

Sierra推出发布治理功能:内置检查、审批与分割流量,规模化安全上线AI代理
Sierra在平台中新增Agent Checks、模拟测试、合并审批流程和分割流量发布,为大型企业代理开发提供自动化质量门与人工审批环节。

LangSmith推出Preview Builds:合并前在临时部署中测试智能体改动
LangSmith的新Preview Builds功能可将拉取请求分支部署为临时生产环境,供团队在合并前测试智能体修改。

Replit推出免费模式,由GPT-5.6 Luna驱动
Replit宣布其新的Free Mode将使用GPT-5.6 Luna模型,允许用户无需担心代币成本即可将想法转化为可运行的软件。
Cursor发布新型Git托管架构,解决大规模仓库托管难题
Cursor博客详细介绍其自研Git托管方案,针对大规模仓库的存储与一致性挑战提出新架构。

LangSmith发布Tuned Evaluators,首个Perceived Error评估器上线
LangChain推出Tuned Evaluators,首个Perceived Error评估器声称以更低成本超越前沿模型,自动评估生产对话中的感知错误。

LangChain推出AgentCore Payments中间件,让智能体能安全支付API费用
LangChain与AWS合作发布AgentCore Payments中间件,为LangChain代理提供确定性支付限额和x402协议支持,实现自动化付费数据访问。

Cursor推出builds:云代理启动速度最高提升3倍
Cursor在后台持续准备开发环境的现成副本,代理无需每次重新克隆仓库和安装依赖,启动速度最高提升3倍。

OpenAI推出Ultrafast API服务:GPT-5.6 Sol处理速度提升达14倍
新服务由Cerebras提供算力支持,输出速度最高可达每秒750个token。
Sierra推出Horizon长期运行AI代理,主动跟进保险客户直至成交
Sierra展示了其Horizon代理如何在保险场景中通过数天至数周的多轮主动沟通(短信、电话)跟进潜在客户,将原本因人力不足而流失的询价转化为保单。

Cursor与SpaceXAI发布Grok 4.6,主打长时程代理任务,性能对标GPT-5.6 Sol
Grok 4.6在Cursor和Grok Build中上线,首周双倍用量,API定价每百万输入token 2美元、输出6美元。
