模型The Decoder AI·原文 2026年9月29日

Anthropic发布Claude Sonnet 5.5:单任务成本最多降 30%,编程测试从 10.3% 升至 70.6%

Anthropic发布Claude 5.5家族第二个模型Sonnet 5.5,输出速度提升超 30%,单任务成本最多降低 30%,在知识工作基准上几乎追平Opus 5.5;编程基准Terminal-Bench 4.0从 10.3% 跳至 70.6%。

AI解读:Sonnet 5.5是Anthropic Claude 5.5家族第二个模型,定位是修bug、写文档、做PPT、建表格这类边界清晰的日常工作;需要复杂判断的任务仍交给Opus 5.5。它每百万token的标价和Sonnet 5完全一样(输入 2 美元、输出 10 美元、缓存读取 0.20 美元),但因为完成任务用的token更少,实际单任务成本最多降 30%,生成速度也快 30% 以上。

这些数字来自Anthropic自己的说法,独立测试还没有验证。

对开发者来说,真正值得看的是编程能力的跳变:在智能体编程测试Terminal-Bench 4.0上,Sonnet 5.5得分 70.6%,前代Sonnet 5只有 10.3%,甚至超过Opus 5.5的 66.4%。

在CursorBench 4.0上,Sonnet 5.5得 55.5%,距Opus 5.5的 57.8% 只差两个百分点。知识工作基准GDPval-AA上,Sonnet 5.5得 1844 分,Opus 5.5是 1846 分,Sonnet 5只有 1449 分。

不过有一个值得注意的例外:在FrontierCode 1.1上,把effort调到最高的Max档,Sonnet 5.5的成绩反而比Xhigh档更低。Anthropic的解释是,最高档会更频繁触发代码审查功能、把工作拆给多个子智能体,有时导致超时或超出任务范围的改动,而这两项都会在FrontierCode中被扣分。也就是说,effort档位并不是越高越好,选档目前更像经验活。

这次发布还伴随着一个安全政策变化。因为Sonnet 5.5在网络安全上的能力远强于前代,Anthropic首次给Sonnet系列加了防护:涉及高风险网络安全任务的请求会被明确改道到Sonnet 5;合格专业人员可以通过扩展后的Cyber Verification Program申请分级访问。Anthropic还加入了针对蒸馏攻击的安全分类器。这些措施是否有效,要等接下来几个月的观察。

Haiku 5.5已宣布将在未来几周发布,主打高吞吐、低成本场景。届时Anthropic将以Fable、Opus、Sonnet、Haiku对上OpenAI的GPT-6 Astra、Sol、Luna等型号。同档位模型之间的性能差距已经不大,价格可能成为决定因素。

Sonnet 5.5现已在AWS、Google Cloud和Microsoft Azure上线,也通过Claude平台以claude-sonnet-5-5的模型ID提供访问,支持零数据保留。

Anthropic发布Claude Sonnet 5.5,这是Claude 5.5家族的第二个模型。据Anthropic介绍,该模型生成输出比前代快 30% 以上,单任务成本最多降低 30%,在多个知识工作基准上几乎追平Opus 5.5。

Sonnet 5.5定位是边界清晰的日常工作,例如修bug、写文档、做演示文稿、建电子表格;Opus 5.5则面向需要仔细判断的复杂任务。Anthropic同时宣布Claude Haiku 5.5将在未来几周发布,主打高吞吐、低成本场景。

Terminal-Bench 4.0从 10.3% 升至 70.6%

Anthropic称Sonnet 5.5相对前代提升最明显的是编程能力。在面向智能体编程的Terminal-Bench 4.0上,Sonnet 5.5得分 70.6%,Sonnet 5为 10.3%。在重现Cursor编辑器真实编程会话的CursorBench 4.0上,Sonnet 5.5得分 55.5%,Sonnet 5为 34.1%,距Opus 5.5的 57.8% 差两个百分点。

在FrontierCode 1.1的High设置下,Anthropic称Sonnet 5.5比Sonnet 5高十分,而每任务成本约为后者的十五分之一。早期测试者评价该模型理解代码库的速度较快,而且比前代更频繁地批量调用工具,从而减少所需步骤。

  • Terminal-Bench 4.0:Sonnet 5.5为 70.6%,Sonnet 5为 10.3%,Opus 5.5为 66.4%(Xhigh设置)。
  • CursorBench 4.0:Sonnet 5.5为 55.5%,Sonnet 5为 34.1%,Opus 5.5为 57.8%。
  • FrontierCode 1.1(Main):Sonnet 5.5在Max设置下为 46.2%,Xhigh设置下为 52.1%;Sonnet 5为 42.4%,Opus 5.5为 54.4%,GPT-6 Sol为 49.3%。

最高effort档成绩反而下降

Sonnet 5.5的推理强度设置存在一个反常之处:在FrontierCode上,把effort调到最高的Max档,成绩反而低于Xhigh档。Anthropic的解释是,在最高effort下,模型更频繁触发代码审查功能,把工作拆分给多个子智能体,有时导致超时或超出任务范围的改动,而这两项都会被FrontierCode扣分。

知识工作基准几乎追平Opus 5.5

在OpenAI开发、覆盖 44 个职业和 9 个行业任务的知识工作基准GDPval-AA上,Sonnet 5.5得分 1844 分,几乎追平Opus 5.5的 1846 分,比Sonnet 5的 1449 分高约 400 分。按Anthropic提供的数据,OpenAI的GPT-6 Sol得 1487 分。

在视觉图表识别测试Chartography上,Sonnet 5.5从 15.6% 升至 61.6%。在AA Briefcase v1.1上,Sonnet 5.5为 1811 分,Opus 5.5为 1822 分,GPT-6 Sol为 1483 分。在带工具的人类最后考试中,Sonnet 5.5为 64.5%,Opus 5.5为 67.7%。在OSWorld 2.1部分评估中,Sonnet 5.5为 80.1%,Opus 5.5为 81.8%。

  • GDPval-AA v2.1:Sonnet 5.5为 1844,Opus 5.5为 1846,Sonnet 5为 1449,GPT-6 Sol为 1487。数据来自预发布版本,一个后来修复的bug可能影响过结构化输出。
  • Chartography(无工具):Sonnet 5.5为 61.6%,Sonnet 5为 15.6%,Opus 5.5为 64.4%,GPT-6 Sol为 53.6%。

定价不变,靠更少token降本

Sonnet 5.5每百万token价格与Sonnet 5相同:输入 2 美元、输出 10 美元、缓存读取 0.20 美元、缓存写入 2.50 美元。Anthropic称,由于每次任务使用的token更少,实际成本最多下降 30%。输出生成速度也提升 30% 以上。这些说法仍需独立测试确认。

与Anthropic其他模型及OpenAI竞品一样,Sonnet 5.5提供可调effort设置,让用户在成本、速度与输出质量之间取舍。Anthropic称,在低或中等设置下,Sonnet 5.5在多个基准上已超过Sonnet 5的最好成绩,而每任务成本约为后者的十分之一。但为每个任务找到合适的effort档位,目前仍更像经验而非科学。

首次为Sonnet加入网络安全防护

Sonnet 5.5目前已在亚马逊云科技、Google Cloud和Microsoft Azure等主要云平台上线,通过Claude平台使用模型ID claude-sonnet-5-5访问,并像Opus 5.5和Sonnet 5一样提供零数据保留。

Anthropic称Sonnet 5.5的网络安全能力远超前代,因此首次为Sonnet模型加入防护措施:涉及高风险网络安全任务的请求会被明确改道至Sonnet 5;合格专业人员可通过扩展后的Cyber Verification Program申请分级访问。Anthropic还加入了针对蒸馏攻击的安全分类器,与其最强模型所用同类。这些措施是否有效,需在未来几个月观察。

Haiku 5.5补齐产品线

Anthropic宣布Claude Haiku 5.5将在未来几周发布,聚焦高吞吐、低成本场景。加上Fable、Opus和Sonnet,Anthropic将拥有对应OpenAI GPT-6 Astra、Sol和Luna的产品组合。按The Decoder的粗略对应,Opus略高于Sol,Sonnet高于Luna,Fable高于Astra,但Anthropic整体定价更高。同档位模型之间的性能差距已经不大,成本可能成为决定因素,Haiku或有助于Anthropic缩小差距。

信息来源

The Decoder AI原始来源