产品AWS Machine Learning·原文 2026年10月6日

GLM 5.3上线Amazon Bedrock:753B MoE模型,面向编程与长周期智能体任务

AWS称Z.ai的GLM 5.3已通过Amazon Bedrock提供,支持OpenAI兼容API、跨区域推理、提示缓存和服务层级;接入面向符合条件的企业客户。Z.ai报告该模型在CyberGym安全基准上得分为 84.5。

AI解读:据Hugging Face Hub上发布的信息,GLM 5.3是 753B参数的混合专家(MoE)模型,面向编程和长周期智能体任务。Z.ai报告该模型在网络安全任务上表现突出,发布时在CyberGym基准上测得 84.5 分。

与今年早些时候登陆Amazon Bedrock的GLM 5相比,AWS列出了三方面变化:编程能力提升(Z.ai称在DeepSWE、Terminal Bench 3.0、FrontierSWE等基准上有竞争力,其内部编程基准较GLM 5.2提升 50%);新出现的网络安全能力;以及更完整的Bedrock集成。AWS称未报告与GLM 5的直接对比,原因是改进幅度导致GLM 5.1发布后基准测试本身被更新。

GLM 5.3支持隐式(默认自动)提示缓存,并在Responses和Chat Completions API上支持显式缓存控制(AWS推荐后者)。显式缓存需通过prompt_cache_options选择模式,并在输入内容块上添加prompt_cache_breakpoint标记;每个断点至少 1,024 个token才有缓存资格。AWS称缓存可降低重复调用同一提示前缀时的延迟和输入成本。

访问方式包括OpenAI兼容的Responses与Chat Completions API,以及Amazon Bedrock的Invoke和Converse API;AWS建议新应用优先使用OpenAI兼容API。模型提供US跨区域推理(us.zai.glm-5.3)和Global跨区域推理(global.zai.glm-5.3)配置文件,并有Flex、Priority、Standard三种服务层级。

AWS用一个授权安全测试作为演示:开源AI渗透测试代理Strix当前文档以GLM 5.3为默认模型,可配置为通过Amazon Bedrock调用,使推理在用户AWS账户控制下运行。AWS强调只能测试自己拥有或获得明确书面许可的应用,并指出LiteLLM目前尚不能解析bedrock/global.zai.glm-5.3,需显式指定Converse API路由和推理配置文件ARN。

AWS在 8 月发布的博客中宣布,Z.ai(智谱AI)的GLM 5.3已在Amazon Bedrock上线。AWS称该模型可通过全托管API调用,用户不需要管理推理基础设施,接入面向符合条件的企业客户。

模型规格与Z.ai自报成绩

据AWS博客引述Hugging Face Hub上发布的信息,GLM 5.3是 753B参数的混合专家(MoE)模型,针对编程和长周期智能体任务优化。Z.ai报告该模型展现出显著的网络安全能力,发布时在CyberGym基准上测得 84.5 分,AWS称这一分数“领先”。

  • 753B参数混合专家模型,面向编程与长周期智能体任务(AWS引述Hugging Face Hub)
  • Z.ai称在DeepSWE、Terminal Bench 3.0、FrontierSWE等编程基准上有竞争力
  • Z.ai报告其内部编程基准较GLM 5.2提升 50%
  • Z.ai报告发布时CyberGym基准得分 84.5

与GLM 5的差异

GLM 5今年早些时候已在Amazon Bedrock上线。AWS称GLM 5.3延续同一谱系,并列出三方面变化:编程能力更强、出现网络安全能力、Bedrock集成更广(跨区域推理配置文件、隐式与显式提示缓存,以及OpenAI兼容的Responses和Chat Completions API与Invoke、Converse的功能对齐改善)。

AWS在博客中说明,没有报告与GLM 5的直接对比,因为改进幅度导致自GLM 5.1发布以来基准测试本身被更新。

  • 更强编程:Z.ai自报多项基准成绩及内部基准提升
  • 新出现的网络安全能力:Z.ai报告CyberGym 84.5分
  • 更广的Bedrock集成:跨区域推理、提示缓存、API功能对齐改善
  • AWS称未报告与GLM 5的直接对比,原因是基准测试已被更新

在Bedrock上的调用方式与限制

GLM 5.3支持默认开启的隐式提示缓存,以及在Responses和Chat Completions API上的显式缓存控制(AWS推荐后者)。显式缓存通过请求中的prompt_cache_options选择模式,并在输入内容块上添加prompt_cache_breakpoint标记以指示可复用提示前缀的结束位置;AWS称每个断点至少需 1,024 个token才有缓存资格。对于每轮重发大型系统提示或仓库上下文的智能体工作负载,AWS称缓存可降低延迟和输入成本。

模型可通过OpenAI兼容的Responses和Chat Completions API,或Amazon Bedrock的Invoke和Converse API调用;AWS建议新应用优先使用OpenAI兼容API。跨区域推理提供US(us.zai.glm-5.3)和Global(global.zai.glm-5.3)两种配置文件,请求发往用户选择的源AWS区域后由Bedrock路由处理。服务层级包括Flex(优化成本,适合对时效要求较低的工作负载)、Priority(优先延迟关键请求,价格更高)和Standard(默认平衡)。

  • 隐式提示缓存默认开启;显式缓存需通过prompt_cache_options选择模式
  • 显式缓存断点每个至少 1,024 个token
  • 支持OpenAI兼容API与Bedrock Invoke、Converse API;AWS推荐新应用使用OpenAI兼容API
  • US与Global两种跨区域推理配置文件
  • Flex、Priority、Standard三种服务层级

安全测试演示及其边界

AWS用一个授权安全测试演示GLM 5.3的智能体能力:开源AI渗透测试代理Strix当前文档以GLM 5.3为默认模型,可配置为通过Amazon Bedrock调用,使模型推理在用户AWS账户控制下运行。演示目标是本地运行的OWASP Juice Shop故意易受攻击示例应用。

AWS在博客中强调,只能测试自己拥有或获得明确书面许可的应用,未经授权对不拥有系统的安全测试在多数司法管辖区属违法,并违反AWS可接受使用政策。AWS还指出,截至目前LiteLLM尚不能解析bedrock/global.zai.glm-5.3,需显式指定Converse API路由和推理配置文件ARN。

AWS同时提到其托管安全服务AWS Continuum,称两种方式互补:Strix等开源代理提供开发者驱动、可深度定制的本地构建测试,Continuum则运行规模化托管评估。

  • Strix文档当前以GLM 5.3为默认模型,可配置为通过Bedrock调用
  • 演示目标为本地运行的OWASP Juice Shop
  • AWS强调仅限测试自有或获明确书面许可的系统
  • LiteLLM尚不能解析bedrock/global.zai.glm-5.3,需显式指定Converse路由和ARN
  • AWS提到托管服务AWS Continuum与开源代理互补

信息来源