Anthropic发布Claude Opus 5.5:性能对标Fable 5.1,运行成本较Opus 5降40%
新模型在智能体编程、计算机使用和知识工作基准上领先,同时输入输出价格下调20%,缓存读取降价60%;Anthropic称这是其呼吁“前沿节奏”后的首个发布,并扩大了生物学和网络安全验证计划。
Anthropic发布了Claude Opus 5.5,这是其新Claude 5.5家族的第一个模型。Anthropic称它在大部分工作上达到Claude Fable 5.1的水平,运行成本比Opus 5低40%。
Opus 5.5在发布前经过了外部评估方测试,包括Frontier Design和METR。Anthropic表示,这是其呼吁“为前沿模型设定节奏”后的首次发布。
定价方面:输入token每百万4美元,输出token每百万20美元,均比Opus 5低20%;缓存读取每百万0.20美元,比Opus 5低60%。Anthropic称缓存读取占智能体与编程工作成本的大部分。输出生成速度比Opus 5快30%以上。
Anthropic同时提高了Pro、Max、Team计划的五小时使用限额,并向订阅用户提供一个可保存、自行选择使用时间的速率限制重置。
Claude Sonnet 5.5和Claude Haiku 5.5将在未来几周发布,Anthropic称它们将带有许多相同的性能、效率和安全改进。
性能与基准:内部测试的编程效率提升
Anthropic称Opus 5.5是其新领先模型,早期测试者在最复杂的工作上看到大幅性能提升。一位测试者用其完成了68万行代码迁移,耗时不到一天,Anthropic称这类工作原本需要一个工程团队数周。
在削减Web应用每个页面加载时间的内部测试中,Opus 5.5在40次尝试中成功39次;Opus 5则只做了较小改进,且改变了应用行为。
另一项测试中,多个Claude模型根据单条提示构建游戏,Opus 5.5在图形和打磨程度上得分高于其他任何模型。
Anthropic称在内部测试中,Opus 5.5用不到三小时审计并修复了20万行代码库;Opus 5耗时超过20小时,且使用的token是2.5倍。
一个被点名的测试者数据:Deloitte Consulting CIO Carl Bennett表示,Opus 5.5在其最低思考设置下,代码审查中捕获了72%的已知bug,而Opus 5在高思考努力下捕获56%,且误报更少、输出量只是一小部分。
GitHub首席产品官Mario Rodriguez表示,在GitHub Copilot CLI和VS Code的测试中,Opus 5.5使用的token和步骤属于测得的最少之列;在VS Code中,它用不到一半的步骤解决了比Opus 5更多的终端任务。
基准分数与成本效率对比
Anthropic公布的基准显示,Opus 5.5在智能体编程、计算机使用和知识工作方面领先。但Anthropic同时表示,在现有能力水平下,基准分数差距已不太能可靠反映真实世界差异,内部使用中Opus 5.5与Fable 5.1的差距比分数显示的更小。
FrontierCode v1.1(Main)得分:Opus 5.5为54.4%,Fable 5.1为50.3%,Opus 5为48.0%,GPT-6 Astra为53.3%,GPT-5.6 Sol为47.5%。
Terminal-Bench 4.0:Opus 5.5为66.4%,Fable 5.1为55.8%,Opus 5为52.3%,GPT-6 Astra为57.9%,GPT-5.6 Sol为37.3%。Anthropic注明Opus 5.5结果为xhigh effort,GPT-6 Astra为high effort,均由OpenAI报告,代表各模型最高分。
AutomationBench:Opus 5.5为40.0%,Fable 5.1为31.4%,Opus 5为26.9%,GPT-6 Astra为41.4%,GPT-5.6 Sol为28.8%。该项由Zapier运行报告,未使用回退模型,防护介入被计为失败,因此分数低于实际使用中的表现。
Humanity's Last Exam(带工具):Opus 5.5为67.7%,Fable 5.1为65.6%,Opus 5为63.6%。
Anthropic举例称,在FrontierCode默认努力水平下,Opus 5.5击败GPT-6 Astra,成本约为其每任务成本的20%;在Terminal Bench 4.0上与Astra持平,成本约为40%;在CursorBench上以约三分之一成本领先GPT-5.6 Sol 11个点。
可将Opus 5.5与Fable 5.1用于HAProxy从C到Rust的翻译:两者重写几乎都通过了HAProxy自身的回归测试,但Opus 5.5耗时9.5小时,Fable 5.1为12小时,成本低51%。
安全、对齐与验证计划
Anthropic称Opus 5.5在其自动化行为审计中取得迄今最好成绩,该审计在数千个模拟场景中测试Claude。它比近期模型更不容易采取难以撤销的行动或越出给定边界,抗提示注入能力也强于Opus 5。
Anthropic表示已扩大对齐测试范围,覆盖更长任务、不可能完成的任务以及基于真实事件建模的场景,但仍存在局限。完整评估细节见Opus 5.5系统卡。
因为Opus 5.5在生物学和网络安全方面与Claude Fable 5.1相当,Anthropic采用了与Fable 5.1类似的防护措施部署。通过审核的机构可即日起申请生命科学验证计划,将Opus 5.5用于生物学研究;未来几周将扩大网络验证计划,经认证的网络安全从业者可将Opus 5.5用于工作。
在提示注入攻击方面,Anthropic称Opus 5.5在其测试的所有设置中(编程、工具使用、计算机使用、网页浏览)均不差于或优于Opus 5。在AI安全公司Gray Swan运行的基准中,Opus 5.5与Fable 5.1并列所有测试模型中提示注入成功率最低。
Anthropic在公告中阐述了双时间线的安全策略:当前模型依靠广泛对齐测试、METR和Frontier Design等外部预发布评估,以及匹配能力的防护;未来模型则收紧强化学习环境过滤、改进对齐奖励、开发自动化安全训练场景生成,并加强可解释性监控。Anthropic称对能完全自动化AI研究工作的模型需要更高的安全标准,不认为上述措施本身足以满足。
沟通与知识工作表现
Anthropic称Opus 5.5的写作比前代更自然,早期测试者认为更清晰易读,回应了对Opus 5的常见反馈。它把最重要的信息放在前面,更少使用行话或特殊措辞,并遵循用户给出的写作规则。
在一个内部测试中,Opus 5.5、Fable 5.1和Opus 5被要求仅根据一个难以找到财报的网页副本撰写某公司季度表现报告,自动评分器核对每个数字和引用。在不同努力设置下,Opus 5.5的18份报告中有16份通过质量门槛;Fable 5.1和Opus 5没有任何一次通过。
投资公司Walleye Capital作为早期测试者报告称,Opus 5.5在其最低设置下基本解决了他们的评估套件;更高设置下表现更好,还发现了评估说明中的一处错误并加以纠正,此前没有其他模型发现该错误。
在分析两家虚构HR软件公司拟议合并的测试中,两个模型都建立了Excel财务模型并制作了高管演示。两者对交易结论一致,但Anthropic称Opus 5.5的模型更全面、演示更易读,而Opus 5有轻微错误;Opus 5.5用时63分钟,Opus 5为93分钟,成本低50%。
GDPval-AA v2.1覆盖44个职业的真实工作,Opus 5.5得分1846 Elo,Fable 5.1为1735,Opus 5为1708。Anthropic称在默认努力(中等)下,Opus 5.5以约五分之一每任务成本击败GPT-6 Astra的最大努力。
Ramp的Staff Software Engineer John Ruelas表示,Opus 5.5的写作像一位好同事,遵循其写作规则,设计规范几乎无需编辑即可使用;在优化测试套件时其推理易于跟进,他放心地发布了变更。