AWS发布aws-ai-ml技能:为编码代理注入SageMaker推理优化能力
Amazon SageMaker AI优化生成式AI推理推出aws-ai-ml技能,通过Agent Toolkit for AWS安装后,Kiro、Claude Code、Codex等编码代理可基准测试端点、推荐部署配置并生成SageMaker Python SDK v3代码。
AI解读:安装后,编码代理可调用该技能对SageMaker AI端点进行基准测试、比较性能运行、推荐实例类型和部署配置,并生成可执行的SageMaker Python SDK v3代码。官方称从安装到开始对话可在 10 分钟内完成。
该技能适用于支持Model Context Protocol(MCP)的编码代理,文中列举了Kiro、Claude Code和Codex。安装前提是本地已有AWS CLI 2.35+和uv,并通过aws configure agent-toolkit自动检测代理并配置AWS MCP Server。Kiro和Claude Code还可在运行时通过AWS MCP Server动态发现和加载技能,无需本地安装。
也可以在Amazon SageMaker Studio中使用:创建JupyterLab空间时需保持私有共享设置,并选择预装该技能的镜像。首次启动需 5 至 10 分钟。使用前需在终端用身份提供商登录编码代理,例如Kiro的命令kiro-cli login --license pro --identity-provider --region us-east-1 --use-device-flow。
执行基准测试时,代理会先确认端点可安全承受负载测试,因为测试会向在线端点发送真实流量。测试完成后提供吞吐量、延迟百分位、首token时间和并发数等实测指标,并会推荐预填充解码等改进机制。代理不会在用户未明确确认时执行有影响的操作。
示例对比中,同一 512/256 token工作量、并发 4 下,Qwen3-8B相比Qwen3-1.7B输出token吞吐高 44.1%、每用户吞吐高 45.9%、请求吞吐高 46.7%、token间延迟改善 33.0%、请求延迟改善 32.0%,但首token时间慢 146.5%。
AWS注明两个模型运行在不同硬件上,Qwen3-8B使用 4 卡ml.g5.12xlarge,Qwen3-1.7B使用单卡L4的ml.g6.4xlarge,性能差异反映约 4 倍算力,而非仅模型本身。
代理生成的代码在你自己的凭证下运行,因此AWS凭证需有调用SageMaker AI API的权限(创建端点、运行基准测试和推荐作业)。该技能本身无需额外IAM配置。文章还提示使用后删除端点、停止或删除JupyterLab空间、清理S3对象以避免持续费用。
Amazon SageMaker AI优化生成式AI推理推出一项名为aws-ai-ml的新技能,通过Agent Toolkit for AWS分发给编码代理。根据AWS Machine Learning博客,该技能为Kiro、Claude Code、Codex等代理注入SageMaker AI推理优化与基准测试的专业能力。
技能功能与适用范围
安装aws-ai-ml后,现有编码代理可执行以下任务:对已有SageMaker AI端点进行基准测试、为模型推荐部署实例类型、比较两次基准测试运行,并生成可执行SageMaker Python SDK v3代码。AWS称该技能是插入任何支持Model Context Protocol(MCP)编码代理的工具包,用户用自然语言描述意图,代理会提出澄清问题并生成基于真实基准和实测性能数据的代码。
官方描述中,所有过程以可见、可读、可修改的代码呈现,不在不透明界面后执行。代理在信息缺失时会主动询问;在执行有影响的动作前会发出警告并要求确认;遇到超出范围的任务会说明可提供的替代方案。
安装与运行方式
AWS给出两种路径。路径A适用于Kiro、Claude Code、Codex或任何兼容MCP的代理:先安装Agent Toolkit for AWS,需要AWS CLI 2.35+和uv,运行aws configure agent-toolkit自动检测代理并配置AWS MCP Server,然后运行npx skills add aws/agent-toolkit-for-aws/skills/aws-ai-ml。之后在代理聊天面板询问“有哪些技能可用”,确认出现aws-ai-ml后即可用自然语言描述意图。
路径B适用于SageMaker Studio:创建私有JupyterLab空间并选择预装aws-ai-ml技能的镜像,首次启动约 5 至 10 分钟;随后在终端用身份提供商登录编码代理,例如Kiro使用kiro-cli login --license pro --identity-provider --region us-east-1 --use-device-flow。若代理报告无可用技能,可检查私有共享设置,或在终端运行ls ~/.kiro/skills/确认目录;如目录为空但 /etc/sagemaker/skills/有技能文件,可运行restart-jupyter-server并刷新页面。
文中指出,Kiro和Claude Code可在运行时通过AWS MCP Server按需搜索和加载技能,无需本地安装,例如询问代理“搜索与数据库相关的AWS技能”。
- 本地安装前提:AWS CLI 2.35+、uv。
- SageMaker Studio使用前提:私有JupyterLab空间和预装技能镜像。
- AWS凭证需具有调用SageMaker AI API的权限,用于创建端点、运行基准测试和推荐作业;技能本身无需额外IAM配置。
基准测试、实例推荐与结果示例
对于已有SageMaker AI端点,用户可要求代理进行基准测试。代理生成Python笔记本,使用SageMaker Python SDK中的Workload.synthetic() 和start_benchmark() API执行负载测试。基准测试会向在线端点发送真实流量,因此代理会在运行前确认端点安全可测。测试完成后提供吞吐量(每秒请求数、每秒输出token)、延迟百分位(p50、p99、首token时间、token间延迟)和并发数等实测指标,并推荐预填充解码等改进机制。
对于需要选择实例类型的模型,代理支持三种来源:存储在Amazon S3的微调或自定义模型(提供S3 URI)、Amazon SageMaker JumpStart的公共基础模型(提供模型ID),以及Hugging Face Hub上的模型(提供模型名称)。对于需要授权的模型,代理会展示许可条款并要求接受条款并提供Hugging Face token。代理生成代码在候选实例和配置上评估模型,然后给出带吞吐量、延迟百分位、首token时间和并发指标的排序部署选项;用户根据成本和性能要求选择。
代理还可比较两次基准测试运行,计算吞吐量、延迟百分位和首token时间的百分比变化,正数表示更好。如果某次运行不存在,代理会先提出运行该基准测试再比较。
AWS提供一组对比数据:同一 512/256 token工作量、并发 4 下,Qwen3-8B与Qwen3-1.7B相比,输出token吞吐分别为 271.2 和 188.2 tokens/s(+44.1%),每用户吞吐 69.4 和 47.5 tokens/s(+45.9%),请求吞吐 1.08 和 0.736 req/s(+46.7%),token间延迟 14 和 20.9 ms(+33.0%),请求延迟 3,658 和 5,382 ms(+32.0%),首token时间 166.3 和 67.5 ms(-146.5%)。AWS注明两个模型运行在不同硬件上:Qwen3-8B使用 4 卡ml.g5.12xlarge(4x A10G),Qwen3-1.7B使用单卡L4的ml.g6.4xlarge,差异反映约 4 倍算力,并非仅模型本身。
清理与费用提示
AWS建议删除基准测试或推荐过程中创建的SageMaker AI端点,停止或删除使用的JupyterLab空间,并移除SageMaker AI默认存储桶中由基准测试和推荐作业存储的S3对象,以避免持续费用。