产品AWS Machine Learning·原文 2026年10月6日本站收录 2026年10月7日

AWS在SageMaker Studio内上线HyperPod Spaces管理界面

数据科学家可直接在SageMaker Studio的IDE and Notebooks标签页创建、启停和打开HyperPod EKS集群上的JupyterLab与Code Editor环境,无需使用CLI或kubectl。

AI解读:此前Space的创建与管理主要依赖HyperPod CLI或kubectl。

通过Studio的HyperPod集群详情页新增的IDE and Notebooks标签页,数据科学家可创建、配置、启动、停止和打开Space,并在浏览器中运行JupyterLab或Code Editor,或通过SSH-over-SSM连接到本地VS Code。

管理员需先完成一次性设置:安装Spaces插件(浏览器访问须选Custom install)、为数据科学家的IAM角色附加三个托管策略、并在 2024 年前创建的Studio域上启用per-user identity propagation。

AWS称配置Spaces插件不额外收费,用户需支付HyperPod集群计算资源和用于SSH-over-SSM的AWS Systems Manager Advanced On-Premises Instance按小时费用;若使用预热节点过度配置,还会产生额外成本。

启用Karpenter过度配置后,Space启动时间可从冷启动的 5–7 分钟降至约 30–40 秒。AWS公布的实测数据基于ml.m5.12xlarge的CPU镜像(约 3.5 GB),GPU场景需另行配置占位Pod和预热GPU节点。

AWS宣布,数据科学家和机器学习工程师现在可以直接在SageMaker Studio用户界面中创建和管理Amazon SageMaker HyperPod EKS集群上的SageMaker Spaces,无需使用命令行工具或kubectl。

该功能通过HyperPod集群详情页新增的IDE and Notebooks标签页提供,用户可在浏览器内启动JupyterLab或Code Editor环境,也可通过VS Code远程连接。

Studio内新增的Space管理能力

AWS表示,新界面提供完整的Space管理UI,涵盖创建、配置、启动、停止和打开Space,消除了日常Space操作对CLI工具的依赖。

  • 通过引导式表单创建Space,可配置计算资源、命名空间、存储、HyperPod Task Governance计算配额管理和镜像设置。
  • 以可搜索表格查看所有Space的名称、应用类型、状态、访问类型、存储、GPU和vCPU分配情况。
  • 选中后一键启动或停止Space,在不用时释放计算资源。
  • 在浏览器中直接打开JupyterLab或Code Editor,或通过所选远程IDE(如VS Code)连接。

管理员与数据科学家的分工

AWS说明,启用该功能需要管理员完成一次性准备工作,之后数据科学家才能创建和打开Space。

  • 管理员安装Spaces插件:从SageMaker AI控制台进入HyperPod集群的IDE and Notebooks标签页,选择Quick install(一键使用优化默认值)或Custom install(启用浏览器访问时必须选择此项)。
  • 为数据科学家的IAM角色附加三个托管策略:AmazonSagemakerHyperpodSpacePolicy、AmazonSagemakerHyperpodUserClusterPolicy和AmazonSagemakerHyperpodSpaceTemplatePolicy。
  • 若Studio域创建于该集成推出之前,需通过命令启用per-user identity propagation,将用户在集群上的操作归属到其EKS access entries和AWS CloudTrail用户配置文件,并强制执行Space所有权规则。
  • 现有运行中的应用不受影响,用户下次登录时应用新设置。
  • 数据科学家在SageMaker Studio中进入Compute → HyperPod,选择IDE and Notebooks标签页,即可看到Space管理界面。Space状态显示Running后,可打开JupyterLab、Code Editor,或在VS Code中连接。

开发环境与可选能力

AWS介绍,JupyterLab Space提供Python 3笔记本、Glue PySpark和Spark控制台、终端、文件浏览器、内置聊天和上下文帮助,工作内容持久保存在挂载的Amazon EBS卷上,停止后重启不会丢失。Code Editor Space提供带语法高亮、IntelliSense、集成终端、扩展支持和Git集成的浏览器内IDE,并可直接访问集群文件系统和挂载的Amazon FSx卷。

通过Open in VS Code连接时,内部使用SSH-over-SSM隧道,无需管理SSH密钥或暴露 22 端口,本地VS Code的扩展、主题和快捷键均可使用。

  • 可选能力包括:浏览器访问(需ALB和Route 53自定义DNS,远程IDE连接不需要)、管理员定义的Space模板、基于Kueue的Task Governance多租户配额与优先级、Karpenter自动扩缩、预热节点过度配置、EFS/FSx持久卷、ECR自定义镜像、空闲自动关闭、NVIDIA MIG分数GPU分配。
  • AWS称这些能力均为可选且可组合使用。

启动延迟与计费

AWS公布,使用Karpenter自动扩缩的冷启动延迟为 5–7 分钟,主要耗时在EC2实例启动、Kubernetes节点注册和SageMaker Distribution镜像拉取。使用标准Kubernetes过度配置模式维持预热且已缓存镜像的节点池后,启动时间可降至约 30–40 秒。

AWS提供的实测数据显示:在ml.m5.12xlarge(24 vCPU可分配、占位Pod 2 vCPU、8 GiB内存)搭配约 3.5 GB的sagemaker-distribution:latest-cpu镜像时,Space与占位Pod共存约 14 秒,Space抢占占位Pod约 35 秒,冷启动为 5–7 分钟。AWS注明该数据仅限CPU,GPU Space需单独的占位Deployment预拉取约 10 GB的GPU镜像,否则GPU节点保持冷状态。

  • AWS说明,配置Spaces插件本身不产生额外费用;用户支付Space消耗的HyperPod集群计算资源,以及用于SSH-over-SSM远程连接的AWS Systems Manager Advanced On-Premises Instance按小时费用。
  • 使用过度配置时,每个预热节点保持一台EC2实例处于Running状态,按需实例会产生额外成本。
  • AWS建议用户查阅AWS Systems Manager定价页面了解详情。

信息来源