模型Anthropic官方新闻·原文 2026年9月28日本站收录 2026年9月29日

Anthropic发布Claude Sonnet 5.5:速度提升 30%+,多数任务成本降低最多 30%

Sonnet 5.5是Claude 5.5家族第二款模型,Terminal-Bench 4.0得分从Sonnet 5的 10.3% 跃升至 70.6%,首次为Sonnet系列配备网络安全防护与防蒸馏分类器。

AI解读:Sonnet 5.5是Claude 5.5系列的第二款模型,定位为Opus 5.5的更快、更便宜搭档:Opus负责需要持续判断的复杂开放任务,Sonnet 5.5擅长的则是范围明确的日常工作,比如改bug、写文档、做幻灯片和表格。对跑量、按固定预算跑持续任务的团队,这个分工比单押一个旗舰模型更划算。

定价没涨。输入每百万token 2美元、输出 10 美元、缓存读取 0.20 美元,和Sonnet 5一致,但Anthropic称它完成同一任务通常消耗的token少得多,实测每任务成本最多低 30%;速度上输出生成快 30% 以上,是迄今最快的Sonnet。

性能提升集中在编程:Terminal-Bench 4.0从Sonnet 5的 10.3% 涨到 70.6%,FrontierCode 1.1比同设置的Sonnet 5高 10 分、每任务成本约为其十五分之一。知识工作上GDPval-AA比Sonnet 5高约 400 分,接近Opus 5.5。但Anthropic也明确说,基准只反映能力的一面,Opus 5.5在复杂、开放、需要持续判断的任务上仍然明显更强。

安全方面,Sonnet 5.5的网络安全能力接近Opus 5,因此成为首个带上Opus级网络防护与降级回退的Sonnet模型:高风险网络安全请求会退回Sonnet 5,常规开发和多数生命科学工作不受影响;它也是首个带防推理提取安全分类器的Sonnet模型。

可用范围包括AWS、Google Cloud、Microsoft Azure及Claude各平台,支持零数据保留。在Amazon Bedrock上通过Global CRIS的global.anthropic.claude-sonnet-5-5推理配置文件调用,Claude Platform on AWS在北美可用;Anthropic预告Haiku 5.5将在未来几周加入家族。

Anthropic发布Claude Sonnet 5.5,这是Claude 5.5家族的第二款模型。Anthropic称它相较Claude Sonnet 5是明确升级:运行快 30% 以上,多数工作成本最多低 30%。

Sonnet 5.5的定位是Claude Opus 5.5的更快、更低成本补充。按Anthropic的说法,Opus 5.5面向需要细致判断的复杂工作,Sonnet 5.5最强的则是边界清晰的日常任务、修bug,以及制作精良的文档、幻灯片和电子表格,同时对设计有敏锐判断。面向高并发和成本敏感场景的Claude Haiku 5.5将在未来几周加入家族。

性能方面,在智能体编程评测Terminal-Bench 4.0上,Sonnet 5.5得 70.6%,Sonnet 5为 10.3%。在覆盖多种职业真实工作测试的GDPval-AA上,它比Opus 5.5低两分。Anthropic称它在长周期任务和图像理解上表现强劲,是首个仅凭截图就能通关《宝可梦 红》的Sonnet模型。

协作方面,与Opus 5.5一样,Sonnet 5.5比上一代模型写作更清晰,早期测试者称它比Sonnet 5更适合作为协作伙伴;其速度也适合在较简单任务上快速迭代。

成本上,Sonnet 5.5定价与Sonnet 5相同:每百万输入token 2美元、每百万输出token 10美元、每百万缓存读取token 0.20美元,但完成同样工作通常需要的token少得多。Anthropic称在其测试中,每个任务的成本比前代最多低 30%。

速度上,Sonnet 5.5生成输出比Sonnet 5快 30% 以上。Anthropic称它是迄今最快的Sonnet模型。

对齐与安全:首个带Opus级网络防护的Sonnet

在Anthropic的自动化行为审计(覆盖约 1850 个场景)中,Sonnet 5.5在对齐、抗滥用和诚实度的大多数指标上优于或持平Sonnet 5。在更新的容器逃逸评测中,Sonnet 5.5接近Anthropic测试过的最佳模型Opus 5.5,是旗下所有模型中尝试探测容器边界可能性最低的一个。Anthropic称,整体审计中Opus 5.5仍略好,但未发现Sonnet 5.5追求与用户意图冲突目标的证据。

Anthropic同时说明,没有任何一组评测能可靠捕捉所有失败,Sonnet 5.5可能存在尚未发现的倾向,因此把自身对齐工作与下述防护措施配合使用。

  • 网络安全:Sonnet 5.5的网络能力较Sonnet 5大幅提升,因此部署时采用与Opus 5.5类似的防护。用户仍可在常规软件开发中查找和修复代码bug,但更高风险的网络安全任务会明显降级回退到Sonnet 5。网络防御者不久可申请扩展的Cyber Verification Program,按层级获得Sonnet 5.5、Opus 5.5和Claude Mythos模型的更高级能力。
  • 生物:Sonnet 5.5使用与Sonnet 5相同的生物防护,针对有害请求;多数研究、教育和临床工作不受影响,但部分微生物学和病毒学请求可能被误标。机构可申请Life Sciences Verification Program,获得面向完整生物学工作的防护访问权。
  • 蒸馏:蒸馏攻击指攻击者用数千个虚假账号大规模提取模型能力,从而在没有Claude内置防护的情况下造出高能力模型。因为Sonnet 5.5远强于前代,它是首个带安全分类器、防止推理提取的Sonnet模型。Sonnet 5.5还扩展了保留思考,使Claude的思考无法与其创建账号解耦。多数开发者不会察觉变化;若在账号间迁移对话(包括在Claude Code会话中途切换账号),Anthropic文档文章有说明。

评分与成本:低中档位即可超过Sonnet 5最好成绩

Anthropic公布的图表把各模型在每个effort档位的得分与每任务成本对照:effort升高,模型通常工作更久、每任务成本更高但得分一般也更高;点越靠左上,单位美元能力越强。Anthropic称,在多项基准上,Sonnet 5.5在Low或Medium effort下就能超过Sonnet 5的最好成绩,而每任务成本约为后者十分之一。

与Opus 5.5搭配时,Sonnet 5.5在较低effort设置下每任务成本更低,是最佳互补;在较高设置下,它可以以相近成本达到可比表现。Terminal-Bench 4.0衡量模型在命令行界面内完成复杂多步专业任务的能力。在Medium effort(Claude应用中的默认档位)下,Sonnet 5.5远超Sonnet 5的最好成绩,且每任务成本不到后者十分之一。

Anthropic注明:Terminal-Bench和OpenAI未公开GPT-6 Sol的性能,因此表中以GPT-5.6 Sol代替。在编程方面,FrontierCode的High effort下Sonnet 5.5比同设置Sonnet 5高 10 分,每任务成本约为其十五分之一;在测试真实Cursor编程会话任务的CursorBench上,其最好成绩与Opus 5.5相差约两分。早期测试者称Sonnet 5.5理解代码库很快,效率也令人印象深刻:在正面对比中,它比Sonnet 5更多地把工具调用批量合并,从而减少步骤、降低成本。

  • Epic Games首席运营官Daniel Vogel表示,在Epic的早期测试中,Claude Sonnet 5.5达到了更高层级模型应有的质量水准,在系统设计审计和数据流审查中表现稳定;新模型处理了数万行游戏系统架构代码,响应保持敏捷,能完成数小时任务,且所需指令性提示更少。
  • Slack首席工程师Curtis Allen表示,在没有改动任何提示的情况下,Claude Sonnet 5.5在几乎所有离线Slackbot评测中都比Sonnet 5表现更好,步骤更少,输出token约少 14%。

知识工作与效率

在覆盖 44 种职业、九大行业的真实任务测试GDPval-AA上,Sonnet 5.5得分几乎与Opus 5.5持平,比Sonnet 5高约 400 分。在计算机使用和图表识别上接近Opus 5.5,在长周期知识工作上明显优于Sonnet 5和GPT-6 Sol。

早期测试者还提到一些不易量化的改进:他们觉得它是更自然的对话伙伴,并称其对设计有感觉,能为用户界面增加打磨,也能遵循幻灯片模板做出几乎无需编辑的演示稿。Anthropic的一个内部测试中,给模型一家上市公司的季度财报材料和电话会议记录,外加一个幻灯片模板,要求生成 10 页经营回顾;两名专家判定其初稿可直接发送。

effort档位可用于平衡成本、速度与质量。在Claude Code和Anthropic应用中默认effort为Medium,Claude Platform默认High。较低档位下Claude回答更快、token更少,适合常规工作;较高档位下会推理更久、更彻底地检查工作。

  • Anthropic展示的速度对比提示为:在一个HTML文件中生成 400 只椋鸟的群飞效果。

可用范围与迁移注意

与Opus 5.5和Sonnet 5一样,Claude Sonnet 5.5支持零数据保留,现已在所有平台可用,包括Amazon Web Services、Google Cloud和Microsoft Azure。开发者可在Claude Platform上使用claude-sonnet-5-5开始。

Anthropic提醒:如果你运行Sonnet时关闭了thinking,在迁移到Sonnet 5.5前需要改用新的between_tools设置,该设置会保持前置思考关闭。详情见迁移指南。

  • AWS同步宣布Claude Sonnet 5.5在Amazon Bedrock和Claude Platform on AWS上可用。Amazon Bedrock让用户在AWS基础设施内使用Sonnet 5.5能力,具备区域数据驻留,并兼容团队已有的AWS控制项,包括IAM访问控制、CloudTrail审计、CloudWatch监控和Amazon Bedrock Guardrails,用量计入AWS账单。
  • AWS建议的分工与Anthropic一致:Opus 5.5负责需要细致判断的编码工作(发布调试、多PR功能栈、大型拉取请求的安全审查、目标明确的代码迁移)以及以成品表格、演示稿或报告收尾的长分析和合同修订;Sonnet 5.5负责方法已明确、只待快速执行的工作,每任务成本更低、速度更快。
  • AWS列举的适用场景包括:告警首轮响应、智能体持续监控、SQL生成、UI与UX测试、IDE中带固定支出上限的快速编程智能体,以及企业范围内面向大量用户的范围明确分析、短表格编辑和常规文档任务。
  • 在Amazon Bedrock上,Sonnet 5.5通过bedrock-runtime的Global CRIS(global.)推理配置文件提供,模型ID为global.anthropic.claude-sonnet-5-5;需Active AWS账号并开通Amazon Bedrock、安装配置AWS CLI、Python 3.10+、boto3,以及bedrock:InvokeModel和bedrock:InvokeModelWithResponseStream的IAM权限。Anthropic与AWS均未在本次公告中给出独立的第三方评测数据,性能与成本数字均来自官方测试。

信息来源