xAI的Grok 4.6上线Amazon Bedrock,支持 500K上下文与四档推理强度
AWS在 2026 年 8 月 18 日宣布xAI的Grok 4.6进入Bedrock模型目录,这是xAI在该平台的第二个模型;它同时出现在bedrock-mantle和bedrock-runtime两个端点,支持Converse API和跨区域推理,并新增xhigh推理档位。
AI解读:Grok 4.6是xAI在Amazon Bedrock上的第二个模型,主打长时间运行的智能体、编码和知识工作。它给到 500K token的上下文窗口,推理强度从low到xhigh分四档,这比Grok 4.3那次的接入面宽了不少——不只走OpenAI兼容的bedrock-mantle,也能走bedrock-runtime,用AWS SDK和Converse API调。
真正影响集成方式的是两个端点的能力差异。想在请求里直接用JSON Schema结构化输出,只能走bedrock-mantle;想要Converse API的流式返回、调用日志,或者跨区域推理,就得走bedrock-runtime。工具调用两边都支持,但不是所有功能都能平移,选错端点意味着要改代码。
跨区域推理也带来了选型空间:全球配置文件global.xai.grok-4.6每百万输入token收 2.00 美元,地理内推理us.xai.grok-4.6收 2.20 美元。如果数据驻留要求不绑死,全球档便宜且容量池更大。比区域更大的价格杠杆是服务层级:Priority是标准价的 1.75 倍,Flex打五折。
对做长链条智能体的团队,xhigh推理档和加密推理内容是可以花钱买深度的旋钮,但推理默认开启、按请求计费,短文抽取和分类这类任务用low更划算——把高推理档留给规划步骤和长轨迹,错误会在后面被放大。
AWS于 2026 年 8 月 18 日宣布,xAI的Grok 4.6已在Amazon Bedrock上线。AWS称这是加入Bedrock模型目录的一款前沿模型,面向长时间运行的智能体、编码和知识工作。
Grok 4.6提供 500K token上下文窗口,支持四档可配置推理强度:low、medium、high、xhigh。这是xAI在Amazon Bedrock上的第二个模型。Grok 4.3正式可用时,xAI作为模型提供方加入Amazon Bedrock,当时该模型只能通过Bedrock Mantle(Amazon Bedrock中兼容OpenAI的推理引擎)访问。
Grok 4.6扩大了接入面:它同时出现在bedrock-mantle和bedrock-runtime两个端点,并支持Converse API、Chat Completions和Responses。
xAI称Grok 4.6强化长轨迹自检与视觉首轮产出
以下训练与能力细节来自xAI的发布公告《Introducing Grok 4.6》,由AWS博客转述。Grok 4.6在Grok 4.5基础上构建,重点放在长时间运行的智能体和更复杂的交互与视觉工作。xAI称该模型能在研究、信息分析、跨代码库工作、把想法变成完整应用等任务上保持多步骤推进。
训练方面,xAI称Grok 4.6的补充训练运行时间比Grok 4.5更长,使用了经过筛选的模型生成数据来训练推理和高级技术概念,并加入高质量工程数据,以及改进的优化器和训练配方。随后xAI用Grok 4.5重新生成监督微调轨迹,覆盖不同推理强度、智能体框架以及STEM、软件工程和知识工作等领域,并用基于模型的检查过滤有问题的轨迹。之后模型在广泛的智能体强化学习任务上训练,包括知识工作、通用编码,以及内核优化、Web开发、计算机辅助设计等特定领域环境。
xAI特别提到两种行为:在较长的轨迹上,模型表现出更多自测和验证,会在继续之前检查自己的工作;在视觉和交互项目上首轮产出更强,能在一次生成中确立应用的结构和视觉语言,xAI团队认为这在“先做出一个像样的东西再迭代”是通往好结果最快路径的场景中有用。
安全方面,xAI称Grok 4.6的防护措施已随模型能力改进和校准,依据是其声称的迄今最广泛的部署前能力与防护校准测试,以及部署后测试和第三方测试。xAI将其安全栈定位为在漏洞修补、加速工程设计周期、增强AI研究等合法用例中最大化效用和安全性。
xAI公布的Grok 4.6 High评测数字
xAI称Grok 4.6在多项智能体编码和知识工作基准上达到前沿智能水平。以下是xAI公布的Grok 4.6 High在 2026 年 8 月 12 日发布时的数据,来源为xAI官网:AA Intelligence Index 61;GDPVal-AA v2 1753;CursorBench v3.2 69.9%;DeepSWE v1.1 65.9%;FrontierCode v1.1(Extended)61.3%;APEX-Agents 57.5%;Terminal-Bench v3.0 26%;APEX-SWE 56.4%;AA-Briefcase 1577;Harvey LAB(Vals)15.8%。
其中多项评测来自Artificial Analysis。据Artificial Analysis,Artificial Analysis Intelligence Index v4.1.1是一个综合指数,包含九项评测:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity’s Last Exam、GPQA Diamond、CritPt、AA-Omniscience和AA-LCR,覆盖智能体工具使用、推理与知识、知识可靠性、长上下文推理,以及针对电子表格和文档的定量分析。
AA-Briefcase是Artificial Analysis的智能体知识工作基准,其Elo分数综合了评分标准通过率、分析质量Elo和呈现Elo,分数越高越好。Artificial Analysis还跟踪成本和延迟:其每任务成本指标是Intelligence Index任务的平均加权成本,由输入、缓存命中、缓存写入、推理和回答token的价格推导而来。AWS博客称,如果工作负载对推理token开销敏感,这个指标是有用的参考。
Bedrock上新增的能力与端点差异
AWS博客列出了几项对Grok 4.6而言新增、而非从上一代Grok延续的Bedrock能力。
bedrock-runtime端点:Grok 4.6除bedrock-mantle外也在bedrock-runtime上提供服务,因此可以用AWS SDK和标准Bedrock控制面访问,而不只是OpenAI兼容客户端。Converse API(含流式):converse和converse_stream都可用,好处是跨模型使用同一种消息结构,并通过常规Converse事件(messageStart、contentBlockDelta、contentBlockStop、messageStop、metadata)流式返回,无需自己解析SSE。
新增xhigh推理强度档位:推理强度可选low、medium、high、xhigh,在需要更深思考的问题上把上限抬高。在Converse上通过additionalModelRequestFields={"reasoning_effort": "xhigh"} 设置,而不是用reasoning参数。
跨区域推理:在bedrock-runtime上通过两个推理配置文件之一路由,而不是固定到单个区域。us.xai.grok-4.6在地理范围内保持流量,适合有数据驻留要求的场景;global.xai.grok-4.6在全球路由,容量池最大。全球档也更便宜,每百万输入token 2.00美元,地理内档为 2.20 美元,因此在没有驻留限制时通常更适合作为默认选择。
Amazon Bedrock Guardrails:Grok 4.6现在在bedrock-runtime上跨其API支持Guardrails,提供内容过滤、拒绝话题、个人身份信息(PII)脱敏和词汇策略。请求中按ID和版本附加防护栏,策略会同时针对提示词和模型响应评估。对智能体工作负载而言,这为可能无人值守运行多步的模型加上了一致性策略边界。
调用日志:启用模型调用日志后,Grok 4.6调用会作为完整的Amazon CloudWatch记录被捕获,包括请求体、响应体、token计数(含推理token)以及所用推理配置文件。用于审计智能体运行时,可以看清模型实际被问了什么。
提示词缓存:缓存输入的计费约为标准输入价格的四分之一,这对每轮都重发大段系统提示词或文档的智能体很重要。缓存作用于重复前缀,因此要把稳定内容放在请求前部,并在usage块中读取缓存token数,确认折扣实际生效后再纳入成本模型。
工具调用、结构化输出、图像输入、响应流式传输和加密推理内容也可用,但这些来自Grok 4.3发布时,已在该篇博客中介绍。
打包方式、区域与定价
Grok 4.6接受文本和图像输入,返回文本。不支持音频、语音、视频和嵌入模态,也不生成图像。
模型可通过两个端点访问,模型ID随端点不同:bedrock-mantle使用模型ID xai.grok-4.6,基础URL为https://bedrock-mantle.{region}.api.aws/openai/v1;bedrock-runtime使用us.xai.grok-4.6(地理)或global.xai.grok-4.6(全球),基础URL为https://bedrock-runtime.{region}.amazonaws.com/openai/v1。
API层面,Grok 4.6支持Responses API、Chat Completions API和Converse API,不支持Invoke API。功能支持因端点而异。在bedrock-mantle上,支持的功能包括客户端工具调用、推理、结构化输出、提示词缓存、响应流式传输、项目和滥用检测。在bedrock-runtime上,支持的功能包括推理、提示词缓存、响应流式传输、调用日志和项目(仅默认项目);该端点不支持结构化输出、服务端工具使用、智能提示词路由、count tokens和应用推理配置文件。工具调用在两个端点上均可用:模型返回结构化函数请求,你的代码执行,再把结果传回。在bedrock-runtime上可以通过Converse的toolConfig或OpenAI兼容的tools参数驱动这一循环。
AWS博客的结论是:如果应用依赖JSON Schema结构化输出,就选bedrock-mantle;如果需要Converse API或调用日志,就选bedrock-runtime。
可用性因端点而异。在bedrock-mantle上,Grok 4.6在US West(俄勒冈)(us-west-2)支持区域内推理。在bedrock-runtime上不提供区域内推理,而是通过跨区域推理配置文件调用:Geo跨区域推理可从美国区域(us-east-1、us-east-2、us-west-1、us-west-2)使用;Global跨区域推理的可用区域列表更长,覆盖美国、加拿大、欧洲、亚太、中东、非洲和南美。Geo跨区域在地理范围内跨区域路由并遵守数据驻留,Global跨区域在没有驻留限制时可在全球任意路由。完整列表超过 30 个区域,AWS建议在固定区域前查看模型卡和按模型的区域可用性页面。AWS称这与Grok 4.3上线时的形态不同:那次仅支持区域内推理,不提供Geo和Global跨区域推理。
服务层级与定价:Grok 4.6支持三个服务层级。Standard按token付费、无承诺,通过设置 "service_tier": "default" 或省略该字段选择。Priority以溢价提供更快、优先的处理("service_tier": "priority")。Flex为对时间不敏感的工作提供更低成本访问("service_tier": "flex")。另两个层级按Standard费率的乘数定价:Priority为 1.75 倍,即 75% 溢价;Flex为 0.5 倍,即 50% 折扣。因此同样一个在Standard区域内每百万输入token花 2.20 美元的工作负载,在Priority上花 3.85 美元,在Flex上花 1.10 美元,层级选择是比区域选择更大的成本杠杆。xAI列出Grok 4.6定价为每百万输入token 2美元起、每百万输出token 6美元起,快速变体价格翻倍。AWS提醒价格和层级会变化,应以Amazon Bedrock定价页面为准。
首次调用与推理强度设置
AWS博客给出的操作步骤:首次调用前,先在Bedrock控制台确认计划使用的区域中模型对你可用。Grok 4.6通过推理配置文件提供服务,而不是在裸模型ID上按需吞吐,这就是bedrock-runtime上请求要写us.xai.grok-4.6或global.xai.grok-4.6的原因。
Grok 4.6使用OpenAI兼容API,设置基础URL后OpenAI SDK可用于任一端点。需安装SDK,以及使用Converse API时所需的boto3:pip install openai、pip install boto3。可从Amazon Bedrock控制台生成长效Amazon Bedrock API key用于探索,然后设置环境变量。bedrock-mantle的OPENAI_BASE_URL为https://bedrock-mantle.us-west-2.api.aws/openai/v1;bedrock-runtime的为https://bedrock-runtime.us-east-1.amazonaws.com/openai/v1。
博客给出三段示例代码:在bedrock-mantle上用Chat Completions API发起首个请求,model传 "xai.grok-4.6";在bedrock-runtime上用Responses API,model传跨区域推理配置文件 "us.xai.grok-4.6";以及用boto3调用Converse API。博客特别提醒,因为推理处于激活状态,第一个content block携带的是推理内容,回答位于后面的块中,所以要遍历块查找文本,而不是直接索引content[0]。在Converse上,推理强度通过additionalModelRequestFields设置,例如additionalModelRequestFields={"reasoning_effort": "xhigh"}。
三条运维注意事项。第一,在bedrock-runtime上Grok 4.6不提供区域内推理,请求必须写us.xai.grok-4.6或global.xai.grok-4.6。第二,bedrock:InvokeModel会针对三个资源评估:账户的默认项目、指定的推理配置文件,以及底层基础模型。基础模型ARN在区域间使用通配符,因为跨区域配置文件会路由到调用区域之外。在OpenAI兼容端点上使用bearer token认证还需要bedrock:CallWithBearerToken,boto3和Converse不需要该权限。博客给出了对应的IAM策略JSON,并提醒要把计划调用的每个推理配置文件都列出来:配置文件是按个授权的,策略里写了us.xai.grok-4.6并不覆盖global.xai.grok-4.6。
第三,两种认证机制覆盖不同的代码路径。放入OPENAI_API_KEY的Amazon Bedrock API key作为bearer token传输,为两个端点上的OpenAI兼容调用提供认证;boto3的Converse示例使用SigV4签名,取自环境、配置文件或角色的普通AWS凭证。如果打算在OpenAI兼容API之外同时使用Converse,两种都要配置。长效API key应仅作为探索用途凭证;生产环境建议使用通过aws-bedrock-token-generator包从IAM凭证生成的短期bearer token,因为它们会自动过期,并把访问权限绑定到IAM身份,这一建议同样适用于Grok 4.6。
关于推理强度:Grok 4.6默认启用推理,通过reasoning参数配置消耗量,可选low(默认)、medium、high、xhigh。xhigh是相对Grok 4.3上线博客所记录的none、low、medium、high而言新增的档位。推理内容是加密的,可以在Responses API请求中传入include: ["reasoning.encrypted_content"] 让它返回,然后在后续轮次把该内容回传,让模型在多轮对话中把自己的先前推理作为上下文。Chat Completions API不返回推理token。加密推理是Responses API的功能。
AWS博客指出,由于推理默认开启、强度按请求设定,强度等级是真实的成本和延迟控制手段:短的抽取和分类调用用low,把high或xhigh留给规划步骤和长智能体轨迹,因为早期错误会累积。针对自身工作负载对推理强度做基准测试,是最快找到更高推理何时不再值得token成本的方法。