CoreWeave上线NVIDIA Vera Rubin NVL72,Cognition首批跑生产负载
CoreWeave宣布其云上正式提供NVIDIA Vera Rubin NVL72与Spectrum-X 102.4T以太网;Cognition的Devin团队早期测试显示,SWE-2推理总token吞吐较GB200 NVL72最高提升4.8倍。CoreWeave同时推出CoreWeave Forge,并计划提供面向AI智能体的NVIDIA Vera CPU。
AI解读:对Cognition这类AI编程公司来说,硬件换代的意义不是跑分,而是“同样的钱能多干多少活”。早期基准显示SWE-2推理的总token吞吐最高提升到GB200 NVL72的4.8倍,这直接关系到实时生成代码的速度和多步推理的响应能力,但注意这是CoreWeave和Cognition自己做的早期测试,不是第三方评测。
另一个容易被忽略的方向是智能体的“沙箱”。强化学习和工具调用需要成千上万个互相隔离的环境同时跑,NVIDIA Vera CPU一个机架128颗CPU、11264个核心,按每环境一个核心算可支撑超过1.1万个并发环境,测试中沙箱启动时间快了3倍以上。对做后训练和智能体评估的团队,这才是能不能把实验规模做大的瓶颈。
CoreWeave Forge是把训练、评估、生产串成一个闭环的工具环境,整合了Weights & Biases、OpenPipe的后训练经验和开源notebook项目marimo,并新增ARIA、Agent Lens和已正式可用的Sandboxes。它想解决的老问题是:生产环境里智能体出的错,往往传不回下一轮训练,信号在工具交接时丢掉了。
真正会被这条新闻影响的人分两类:一类是正在为智能体推理成本发愁的AI团队,他们现在多了一个可选的云平台和硬件代际;另一类是做医疗等垂直场景的买家,比如Ennoble Care已在CoreWeave上预订RTX PRO 6000做临床文档和决策支持的AI推理。至于Vera Rubin是否真能像NVIDIA说的那样“跨代持续回本”,还需要更多独立负载的数据。
CoreWeave在旧金山举行的CoreWeave Fully Connected活动上宣布,其云平台开始提供NVIDIA Vera Rubin NVL72系统,并搭配Spectrum-X 102.4T以太网网络。
应用AI实验室Cognition——也就是AI软件工程师Devin背后的团队——成为首个在Vera Rubin上运行生产负载的客户。
CoreWeave还将提供NVIDIA Vera CPU,NVIDIA称这是首款为AI智能体打造的CPU。
同时,CoreWeave推出CoreWeave Forge,一个在NVIDIA加速计算上训练、评估和改进模型与智能体的连通环境。
Cognition在Vera Rubin NVL72上的早期测试:SWE-2推理token吞吐最高提升4.8倍
Cognition在CoreWeave上运行Devin的训练、强化学习和生产推理。据NVIDIA博客,该公司在九个月内把CoreWeave上的GPU规模扩展到数千块,支撑Cognition的推理负载。
CoreWeave在本月早些时候收到首批Vera Rubin NVL72生产机架。随后不久,Cognition用真实的软件工程负载,把Vera Rubin的推理性能与GB200 NVL72基线做了对比。为生成这一负载,它从FrontierCode中抽取了一部分任务,并部署AI智能体去解决。
在早期测试中,Cognition看到Vera Rubin NVL72在SWE-2推理负载上的总token吞吐较GB200 NVL72最高提升4.8倍。NVIDIA博客称,对Devin而言,这意味着更快的实时代码生成和更敏捷的多步推理。
Cognition创始团队成员Silas Alberti在博客中说:“智能体编程是复杂负载:长上下文、高并发、以及决定我们能交付什么的每token成本。把所有这些东西放在一个平台上,加上NVIDIA和CoreWeave的工程师跟我们一起啃硬骨头,对我们来说比任何单项规格都重要。”
- Cognition是首个在Vera Rubin上跑生产负载的客户
- 测试基线为GB200 NVL72,负载取自FrontierCode任务子集
- 最高提升4.8倍指的是SWE-2推理负载的总token吞吐
- Cognition九个月内将CoreWeave上GPU扩展至数千块
CoreWeave云上提供Vera Rubin NVL72,并通过Kubernetes与推理服务等入口开放
CoreWeave宣布在CoreWeave Cloud上提供NVIDIA Vera Rubin NVL72,NVIDIA称CoreWeave由此成为首批把该平台交付到客户手中的云厂商之一。早期访问客户可以较快地在CoreWeave Cloud上使用NVIDIA所称的“全栈AI工厂平台”性能。
据NVIDIA博客,CoreWeave在数天内为Cognition搭建起一个生产级Vera Rubin集群。该博客将这一速度归因于NVIDIA与CoreWeave从基础设施到token服务、贯穿全栈的协同设计。
该容量可以通过CoreWeave Kubernetes Service、SUNK、CoreWeave Mission Control、CoreWeave Sandboxes和CoreWeave Inference来运营。
- CoreWeave Cloud上提供Vera Rubin NVL72
- 早期访问客户可使用该平台
- 数天内为Cognition搭建生产级集群
- 可通过CoreWeave Kubernetes Service、SUNK、Mission Control、Sandboxes、Inference运营
NVIDIA Vera CPU面向智能体沙箱:单机架128颗CPU、11264核心,启动快3倍以上
NVIDIA Vera CPU是专为智能体负载打造的CPU。NVIDIA博客指出,智能体AI给基础设施带来两个方向的压力:服务智能体需要大规模低延迟算力,而通过后训练改进它们又需要同时运行数千个隔离环境。
对智能体AI来说,一个关键性能指标是能同时运行多少个隔离的智能体环境,以及随着数量增长,每个环境能保持多高的一致性和性能。
CoreWeave部署的Vera在单个机架中放入128颗CPU、11264个核心,按每个环境一个核心计算,足以支撑超过11000个并发环境。配合CoreWeave Sandboxes,这些环境是硬件隔离的,并与它们所支持的训练任务并行运行;Spectrum-X以太网交换机和BlueField-4 DPU负责保障安全、高性能、低延迟的智能体通信。
在测试中,CoreWeave在NVIDIA Vera CPU上实现了沙箱启动时间3倍以上的提升,从而加速并扩展其Sandboxes。NVIDIA博客把Sandboxes描述为强化学习、智能体工具使用和模型评估的执行层,让AI团队在CoreWeave的隔离环境中运行代码。
在Terminal-Bench上,CoreWeave在所有通过任务上看到Vera CPU带来1.7倍性能提升。
- Vera CPU单机架:128颗CPU、11264核心,可支撑超11000个并发环境
- 沙箱启动时间在测试中快3倍以上
- Terminal-Bench所有通过任务上性能提升1.7倍
- Spectrum-X以太网与BlueField-4 DPU负责低延迟安全通信
CoreWeave Forge:把生产行为接回训练与评估
NVIDIA博客称,模型和智能体通过一个循环来改进:生产行为为下一轮训练提供信息,每次评估又打磨下一个版本。这个循环过去分散在不同厂商的工具里,每次交接都会丢失信号。
CoreWeave Forge把Weights & Biases、OpenPipe的后训练经验以及开源的marimo notebook项目统一到一个连通环境中,用于持续改进模型和智能体。NVIDIA称它保持开放,跨越模型、框架和云。
博客列出的新增和扩展能力包括:CoreWeave ARIA现已正式可用,帮助用户学习、研究、编码和在AI循环中迭代,分析运行、提出实验、推荐代码改动并存储到GitHub,再把可执行的证据带回来,分析实验数据、指出是什么驱动了变化并提出下一轮实验。
CoreWeave Agent Lens是一项新服务,把生产环境中的智能体可观测性转化为持续改进和可理解的洞察。NVIDIA称它把失败检测提升了20%,并以一半的成本修复问题,将数千万条生产智能体trace转化为推动修复的洞察。
CoreWeave Sandboxes现已正式可用,让用户在隔离的CPU或GPU执行环境中运行智能体、工具调用、强化学习和评估;可以跑在无服务器基础设施上,也可以跑在他们已经用于训练的同一套基础设施上,为每次智能体工具调用、强化学习运行或评估提供全新的隔离环境。
博客称,后训练利用用户自己的生产信号提升模型质量并降低延迟和成本,且不需要训练集群。无服务器监督微调和无服务器强化学习让用户试验自己的训练配方;其中无服务器强化学习相比自管理配置训练速度快1.4倍、成本低40%。
NVIDIA Dynamo是一个面向AI工厂的开源推理框架,为CoreWeave的托管推理服务以及目前处于私有预览的RL Rollouts提供动力。RL Rollouts在实时部署中加载新检查点,使强化学习无需重新部署就能继续,并让后训练获得与生产相同的推理效率。
Canva、Capital One和MasterClass是首批在Forge上构建的公司。NVIDIA Nemotron开源模型让Forge上的团队可以直接定制和部署面向智能体工作流的推理与多模态模型。
- Forge整合Weights & Biases、OpenPipe后训练经验与marimo
- ARIA、Sandboxes已正式可用,Agent Lens为新服务
- Agent Lens称失败检测提升20%、修复成本减半
- 无服务器强化学习称训练快1.4倍、成本低40%
- RL Rollouts处于私有预览,可在运行中的部署加载新检查点
- Canva、Capital One、MasterClass为首批Forge用户
从初创公司到大型企业:Ennoble Care等已选CoreWeave跑临床AI推理
NVIDIA博客称,AI实验室、AI原生公司和全球企业正在使用NVIDIA与CoreWeave共同工程的平台,更快地从原型走向生产。
在医疗领域,服务约5万名高需求Medicare患者、覆盖15个州的居家护理提供方Ennoble Care选择了CoreWeave运行临床AI推理。它将使用CoreWeave Kubernetes Service上预留的NVIDIA RTX PRO 6000 GPU容量,扩展用于临床文档、决策支持和后台自动化的AI智能体。
博客还提到,CoreWeave在每一轮训练和推理的MLPerf中都取得了创纪录的结果;它是唯一在SemiAnalysis ClusterMAX 1.0、2.0和3.0中均持有Platinum评级的云厂商,并服务于10家领先AI实验室中的9家。
- Ennoble Care服务约5万名高需求Medicare患者、覆盖15个州
- 其将使用预留的NVIDIA RTX PRO 6000 GPU容量
- 用途为临床文档、决策支持和后台自动化的AI智能体
- CoreWeave称服务10家领先AI实验室中的9家