xAI Grok 4.7上线Amazon Bedrock:50万token上下文、四档推理强度
AWS博客称,xAI的Grok 4.7现已在Amazon Bedrock模型目录中提供,支持Responses、Chat Completions和Converse API,通过跨区域推理配置文件提供服务。
AI解读:Grok 4.7现在能在Amazon Bedrock上直接调用,不用单独接xAI的接口。它带来 500K token的上下文窗口和低、中、高、xhigh四档推理强度,适合需要长时间跑任务的编程和知识工作场景。
代价藏在账单里。Artificial Analysis的测试显示,Grok 4.7在智能指数任务上的输出token约为 81k,而Grok 4.6约为 38k,几乎翻倍;默认推理强度是high,如果latency敏感或调用量大,不显式调低就会多花推理token。
对已经在用Bedrock的团队,这件事的实用价值在于不用再维护一套单独的鉴权和消息格式:OpenAI SDK走 /openai/v1路径,AWS SDK走Converse,提示缓存、Guardrails、调用日志和结构化输出都能直接挂上。
安全方面,xAI称Grok 4.7用了全新的防护栈,是其测试过拒绝和抗越狱最强的模型;在网络安全等两用领域,只放行一小部分高风险提示,同时很少拦截合法的安全研究工作。这部分是xAI自述,没有第三方复核数据。
AWS机器学习博客发布消息,xAI的Grok 4.7现已在Amazon Bedrock上线,进入Bedrock模型目录。该模型面向编程、长时间运行的agent和知识工作,提供 500K token上下文窗口,支持低、中、高、xhigh四档可配置推理强度。
Grok 4.7在bedrock-runtime端点上通过跨区域推理配置文件提供服务,支持Responses、Chat Completions和Converse API。模型接受文本和图片输入,返回文本。
文章中的能力和训练细节来自xAI于 2026 年 9 月 21 日发布的Introducing Grok 4.7公告及模型文档。xAI称这是其编程和知识工作能力最强的模型,重点是耐力而非速度:在困难任务上工作更久,并在继续之前更仔细地核查自身输出。
xAI报告Grok 4.7使用了新的、更大的基础模型,用更长的强化学习训练,任务组合更难,刻意偏向需要数小时完成的问题。由此带来两点:模型更擅长验证自身工作,在长任务中更有效地利用 500K token上下文窗口。xAI还训练它原生理解Grok Bot harness。
xAI称该模型在多项已发布评测上有提升,覆盖CursorBench、DeepSWE的软件工程,Terminal-Bench和AA Briefcase的多小时终端与办公工作,EEBench的电气工程,Harvey Legal Agent Benchmark的法律工作,以及HealthBench Professional的临床推理。
Artificial Analysis的独立评测数据
Artificial Analysis运行自己的评测,不依赖开发者报告的数字,可作为xAI发布结果之外的第二参考。据其数据,Grok 4.7在整个评测套件上均有提升,最大增益出现在长时程agent知识工作和在xAI自有harness中运行的编程agent。
Intelligence Index是由多项独立评测组成的综合指标,覆盖agent工具使用、推理与知识、知识可靠性和长上下文工作。
- Intelligence Index:Grok 4.7为 46,Grok 4.6为 44
- Coding Agent Index:56 对 47
- AA-Briefcase长时程知识工作(Elo):1,657 对 1,546
- GDPval-AA专业工作产品(Elo):1,695 对 1,605
- AA-Omniscience Index:32 对 30
- AA-Omniscience幻觉率:29% 对 34%
- 每个Intelligence Index任务的输出token:约 81k对约 38k
推理强度与成本控制
Grok 4.7的推理始终开启,推理强度是控制成本与延迟的主要手段。Responses API通过reasoning参数设置low、medium、high或xhigh,Converse通过additionalModelRequestFields设置,默认值为high。AWS博客建议显式设置,因为在延迟敏感或高并发的调用中,不设置会消耗比实际需要更多的推理token。
由于模型被训练为工作更久并核查自身输出,更高的effort不只换来对单个答案的更多思考,还换来长任务中更多的自我检查。短提取和分类调用适合low;多步规划、长agent轨迹以及早期错误会传播的工作,适合high和xhigh。
推理内容是加密的。在Responses API请求中传入include: ["reasoning.encrypted_content"] 可以让其返回,再在后续轮次中把该内容发回,让模型在多轮对话中获得自己此前的推理作为上下文。Chat Completions API不返回推理token。
Bedrock上的模型ID、API与区域路由
请求必须指定us.xai.grok-4.7或global.xai.grok-4.7,而不是裸模型ID。两个配置文件通过bedrock-runtime接入:地理跨区域us.xai.grok-4.7的Base URL为https://bedrock-runtime.{region}.amazonaws.com/openai/v1,全球跨区域global.xai.grok-4.7使用同一路径。
bedrock:InvokeModel权限会针对三个资源评估:账户的default project、请求指定的推理配置文件,以及底层基础模型。由于跨区域配置文件会把请求路由到调用区域之外,基础模型的ARN需按区域通配。使用bearer token鉴权还需要bedrock:CallWithBearerToken;boto3和Converse不需要该权限。策略必须逐一列出计划调用的推理配置文件,命名us.xai.grok-4.7的策略不覆盖global.xai.grok-4.7。
- OpenAI SDK走 /openai/v1路径,使用bearer token,可以是Amazon Bedrock API密钥或从IAM凭证生成的短期token
- AWS SDK通过Converse到达同一模型,使用普通AWS凭证进行SigV4签名
- 若同时使用Converse和OpenAI兼容API,需要配置两种鉴权机制
- 长期API密钥仅适合探索;生产应使用aws-bedrock-token-generator从IAM凭证生成短期bearer token
Bedrock功能与计费层级
隐式提示缓存会自动作用于重复的提示前缀,因此在每轮都重发大段系统提示或参考文档的agent上,该前缀按缓存费率计费。Amazon Bedrock Guardrails通过ID和版本附加到请求上,对提示和响应同时应用内容过滤、拒绝主题、个人身份信息脱敏和词策略,AWS博客认为这对可能无人值守运行多步的模型有用。结构化输出可把响应限制为JSON Schema,便于下游代码直接解析。调用日志会把每次调用的请求、响应和token计数(包括推理token)记录到Amazon CloudWatch。
服务层级方面,Standard为按token付费、无承诺,设置 "service_tier": "default" 或省略该字段;Priority提供更快、优先的处理,收取溢价;Flex为对时间不敏感的工作提供更低成本。具体token价格见Amazon Bedrock定价页。
区域与推理方面,Global配置文件global.xai.grok-4.7会把每个请求路由到任何受支持商业AWS区域,分散负载,价格低于地理配置文件,代价是对请求处理位置控制更少,延迟可能更不稳定;US地理配置文件us.xai.grok-4.7将处理保留在美国地理范围内,用于满足美国数据驻留要求,适合有驻留限制或延迟敏感的场景。
安全与网络安全
据xAI称,Grok 4.7使用全新的防护栈构建,是其在拒绝和抗越狱方面测试过的最强模型。xAI把网络安全和生物等两用领域的目标描述为同时满足两件事:对合法任务保持有用,同时拒绝危险任务。在网络安全方面,xAI报告该模型只放行一小部分有风险的两用提示,同时很少拦截合法的安全研究工作。
xAI还开始向选定的网络安全合作伙伴提供邀请制访问,使用Grok 4.7的红队能力进行防御研究。