阿里开源2.4万亿参数Qwen3.8,AWS发布SageMaker HyperPod部署指南
Qwen3.8-2.4T-A95B是首个开放权重的Qwen-Max级模型,总参数2.4万亿、每token激活950亿。AWS官方博客详细演示如何在8卡B300实例上以NVFP4量化、约1.2TB权重完成部署。
AI解读:阿里Qwen团队于2026年8月12日发布了Qwen3.8-2.4T-A95B,这是Qwen-Max级别模型首次开放权重。2.4万亿总参数、每token激活950亿,原生上下文262K、可扩展至1M。AWS的这篇博客就是教你怎么在自家云上跑起来,而不是用API。
部署的关键是量化。BF16精度下权重就要4.8TB,单机8卡装不下;NVFP4量化把权重压到约1.2TB,正好塞进8张B300(共2.1TB HBM3e)的节点。类似IBM和Linux基金会的关系,AWS开源了完整部署配置和代码,你照着抄就能用,不用自己从零调vLLM参数。
对于想自托管前沿级模型的团队来说,这是把选择权从API厂商手里拿回来的机会——数据留在自己基础设施内,没有按token计费,还能按需控制推理深度。但代价是运维复杂度:2.4T模型不是普通GPU能跑的,需要预定p6-b300实例、管理集群、监控节点健康。
普通开发者暂时不需要行动,因为光是硬件门槛就很高(p6-b300实例需要Flexible Training Plan预定,且非按需可用)。真正相关的是那些有大规模agentic工作负载、又不想受制于API限额或数据合规要求的企业。在动手之前,建议先跑一遍AWS提供的Manifest和脚本做概念验证,重点看实际吞吐和延迟是否能满足你的并发需求。
AWS机器学习博客于2026年8月12日(同日阿里发布模型)刊文,介绍如何在Amazon SageMaker HyperPod上使用vLLM部署Qwen3.8-2.4T-A95B。这是阿里Qwen团队首次将Qwen-Max级模型以开放权重形式发布,总参数2.4万亿、每token激活950亿,采用线性注意力加全注意力的混合架构,原生上下文262K token、可扩展至1M。
模型架构与关键规格
Qwen3.8-2.4T-A95B是Qwen系列中最大、能力最强的模型,采用细粒度MoE架构:512个路由专家加1个共享专家,每token激活10个路由专家,共92层,层布局为3×(Gated DeltaNet → MoE)后接1×(Gated Attention → MoE)的循环模式。最大输出长度128K token。
混合注意力设计用于高效长上下文:69层Gated DeltaNet使用线性注意力,通过有界循环状态替代随上下文增长的KV缓存;23层Gated Attention使用全量二次注意力。3:1的比例在上下文接近1M时仍能控制计算和内存开销。细粒度MoE使每token仅激活约950亿参数,服务成本与激活参数挂钩而非总参数。
- 总参数:2.4万亿(NVFP4量化后权重约1.2TB)
- 激活参数:每token 950亿
- 上下文窗口:262,144 token原生,可扩展至1,010,000
- 多token预测:模型内置MTP草稿头,无需额外下载
能力与推理控制
Qwen3.8面向多步编码、自主工具调用、长周期规划和复杂研究流程。通过reasoning_effort参数(low、medium、high)按请求调整推理深度。开放权重发布于Hugging Face标准Transformers格式,社区量化版本包括MXFP4和NVFP4(W4A4)。
根据厂商基准测试,Qwen3.8在PaperBench达到93.0、IFBench 82.8、终端编码86.6,与领先前沿模型相当;在SWE-bench Pro和Toolathlon等仓库级任务上仍有提升空间。
基础设施与NVFP4量化必要性
ml.p6-b300.48xlarge实例配备8× NVIDIA B300(Blackwell Ultra),每GPU 288GB HBM3e、总2.1TB、8TB/s带宽,FP4算力约15 PFLOPS/GPU,192 vCPU、4,096GiB内存、3.8TB NVMe。该类实例不可按需获取,必须通过Flexible Training Plan预定。
BF16精度下权重约需4.8TB内存,超出单节点容量。NVFP4量化将权重压缩至约1.2TB,剩余空间用于KV缓存和激活。内存预算:权重1.2TB、DeltaNet循环状态固定50–100GB、激活和开销100–200GB,可用余量约500–700GB。
- 对比:NVIDIA Day-0基准(GB300 NVL72, FP8)显示 >4K tokens/sec/GPU,单个p6-b300节点吞吐略低
- 完整部署(含权重下载)约需15–30分钟,冷启动时间取决于网络
- 后续重启可通过本地NVMe缓存显著加速
vLLM配置与功能支持
vLLM serving命令使用 --tensor-parallel-size 8分布到8张GPU,--quantization nvfp4启用NVFP4量化,--reasoning-parser qwen3提取推理内容。推理默认开启,可通过extra_body中的enable_thinking: False按请求关闭。
工具调用支持OpenAI兼容接口,tool_choice可选auto/required/none/命名函数,仅在content字段解析工具调用,推理内容不参与函数调用解析。vLLM的MTP生性解码通过内置草稿头实现,无需单独模型,num_speculative_tokens默认1,可增至2–3调优。
- 关键启动参数:--enable-auto-tool-choice、--tool-call-parser qwen3_coder(Manifest中)或qwen3(基础命令中)
- 支持structured output(guided_json, guided_regex),仅约束content字段
- 前缀缓存(--enable-prefix-caching)对多轮agent对话高度优化
部署步骤与资源配置
部署前需创建HyperPod集群(EKS托管),配置Flexible Training Plan覆盖ml.p6-b300.48xlarge,将实例组的Target Availability Zone与计划分配对齐。InferenceEndpointConfig清单指定模型源(Hugging Face上的Inferact/Qwen3.8-2.4T-A95B-NVFP4)、镜像vllm/vllm-openai:qwen38、8 GPU资源限制。
应用后监控流程:模型下载(约1.2TB)→ fastsafetensors加载↑→ 健康检查→ 端点就绪。端点暴露OpenAI兼容API,可使用OpenAI Python SDK调用。完整部署清单和脚本已公开在GitHub仓库。
- 预置步骤:创建集群→ 配置培训计划→ 添加p6-b300工作组→ 验证kubectl get nodes
- 端到端调用示例:chat completion含推理轨迹打印,流式响应检查delta的reasoning_content属性
- 工具调用示例:定义包含strict: true的工具,模型先推理后输出结构化调用