Anthropic发布Claude Opus 5.5:多数任务追平Fable 5.1,运行成本比Opus 5低约 40%
Anthropic称Opus 5.5在多数任务上达到Claude Fable 5.1水平,token价格下调 20%、缓存读取费用下调 60%,并首次为Opus系列配备与Fable 5.1同级别的网络安全、生物和前沿LLM开发防护;Sonnet 5.5与Haiku 5.5预计数周内推出。
AI解读:这次降价主要影响高频调用API的开发者和订阅用户。Anthropic把定价和token用量放在一起算,称总运营成本约降四成;订阅用户的五小时使用额度增加 20%,在实际消耗下可多撑 25%,还允许用户把一次额度重置留到需要时再用。对每天跑大量agent任务的人来说,这比单纯刷榜更有感知。
另一个被点名的问题是Claude模型长期被吐槽的行文风格,俗称“Claudish”——公式化、绕、术语多。Anthropic称Opus 5.5会先讲重点、少用行话、更严格遵循写作指令,早期测试者反馈更清晰易读。这项改进目前只有公司说法和早期测试者评价,没有公开的独立文风评测数据。
安全方面,Opus 5.5是首个配备与Fable 5.1同级别网络安全、生物学和前沿LLM开发防护的Opus模型。触发防护时,请求会透明地路由到其他模型:多数网络安全任务转到Opus 4.8,生物学或前沿LLM开发相关请求转到Opus 5。可验证机构可通过生命科学验证计划申请将其用于生物研究,Anthropic计划数周内把网络验证计划扩展到Opus 5.5。
Opus 5.5已上线所有平台,包括AWS、Google Cloud和Microsoft Azure,Claude Platform上的模型ID为claude-opus-5-5。它同时带来反蒸馏措施“Preserved Thinking”,防止API用户编辑Claude的先前上下文来提取推理过程,适用于 2026 年 8 月 31 日及之后创建的API账户,并加入水印以符合欧盟AI法案。模型不再能在关闭Thinking模式的情况下运行。
Anthropic还表示将更严格审查强化学习环境,并研究更好的对齐奖励、自动生成安全训练场景和更强的监控措施。公司呼吁对可能完全自动化AI研究的模型设立更高安全标准,并认为公共政策应在其中发挥更大作用。Opus 5.5发布前由Frontier Design和METR进行了外部测试。Sonnet 5.5和Haiku 5.5预计数周内推出。
Anthropic发布Claude Opus 5.5,这是新系列的首个模型。公司称其在多数任务上达到Claude Fable 5.1的水平,运行成本比Opus 5低约 40%,输出生成速度快 30% 以上。
价格方面,Opus 5.5输入token为每百万 4 美元、输出为每百万 20 美元,低于Opus 5的 5 美元和 25 美元,token价格下调 20%;缓存读取费用从每百万 0.50 美元降至 0.20 美元,降幅 60%。
Anthropic称,把token价格和token用量一起计算,总运营成本应比Opus 5低约 40%。订阅用户的五小时使用额度增加 20%,在模型消耗更低的情况下额度整体可多撑 25%,用户还可以保留一次额度重置,留到最需要时使用。
Opus 5.5已上线所有平台,包括Amazon Web Services、Google Cloud和Microsoft Azure。开发者通过Claude Platform使用模型ID claude-opus-5-5访问。Sonnet 5.5和Haiku 5.5预计数周内推出,Anthropic称它们将有类似的性能、效率和安全提升。
基准测试:多数任务领先Fable 5.1和GPT-6 Astra
Anthropic的基准测试显示,Opus 5.5在多数任务上领先Fable 5.1和OpenAI价格高得多的GPT-6 Astra。
Anthropic用编程基准来支撑其价格与性能主张:在FrontierCode上,公司称Opus 5.5击败OpenAI的GPT-6 Astra,每任务成本约为后者的 20%;在Terminal-Bench 4.0上,它称性能与Astra相同,成本为后者的 40%;在CursorBench上,它称Opus 5.5领先GPT-5.6 Sol 11个百分点,成本为后者的三分之一。
- Agentic coding Terminal-Bench 4.0:Opus 5.5 66.4%,Fable 5.1 55.8%,Opus 5 52.3%,GPT-6 Astra 57.9%,GPT-5.6 Sol 37.3%
- Agentic coding FrontierCode v1.1(Main):Opus 5.5 54.4%,Fable 5.1 50.3%,Opus 5 48.0%,GPT-6 Astra 53.3%,GPT-5.6 Sol 47.5%
- Agentic coding CursorBench 4.0:Opus 5.5 57.8%,Fable 5.1 51.8%,Opus 5 46.6%,GPT-6 Astra无数据,GPT-5.6 Sol 41.7%
- 知识工作GDPval-AA v2.1:Opus 5.5 1,846,Fable 5.1 1,735,Opus 5 1,708,GPT-6 Astra 1,542,GPT-5.6 Sol 1,588
- 业务工作流AutomationBench:Opus 5.5 40.0%,Fable 5.1 31.4%,Opus 5 26.9%,GPT-6 Astra 41.4%,GPT-5.6 Sol 28.8%
- 多学科推理Humanity's Last Exam(使用工具):Opus 5.5 67.7%,Fable 5.1 65.6%,Opus 5 63.6%,GPT-6 Astra 57.2%,GPT-5.6 Sol无数据
- Agentic科学研究Terminal-Bench-Science 0.1:Opus 5.5 58.7%,Fable 5.1 52.6%,Opus 5 29.0%,GPT-6 Astra 64.6%,GPT-5.6 Sol 22.4%
- 计算机使用OSWorld 2.0(部分完成):Opus 5.5 81.8%,Fable 5.1 80.7%,Opus 5 74.0%
- 视觉图表识别Chartography(使用工具):Opus 5.5 89.0%,Fable 5.1 88.4%,Opus 5 83.4%
Anthropic称Opus 5.5写得更自然,减少“Claudish”
Opus 5.5还被寄望于比早期模型沟通得更自然。Anthropic称它把最重要的信息放在前面、少用行话、更严格地遵循写作指令。早期测试者形容其写作更清晰易懂,Anthropic称这使它更适合长时间协作。
现有Claude模型因公式化、绕来绕去的文风而受到不少批评,有时被称为“Claudish”。Anthropic表示,新系列主要回应客户在成本、效率和沟通质量方面的反馈,尤其在金融服务、法律和软件开发领域。
安全防护与请求路由
Opus 5.5是首个配备与Fable 5.1同级别网络安全、生物学和前沿LLM开发防护的Opus模型。Anthropic称,当这些防护触发时,请求会被透明地路由到另一个模型。
用户仍可查找并修复代码中的bug,但多数网络安全任务会转到较旧的Opus 4.8。被分类器标记为生物学或前沿LLM开发相关的请求会转到Opus 5。可验证组织可以通过生命科学验证计划申请将其用于生物研究;Anthropic计划在未来数周把现有的网络验证计划扩展到Opus 5.5。
Anthropic还表示将更严格地筛查强化学习环境,称有缺陷的训练环境是模型行为错位的主要来源之一。公司正在研究更好的对齐奖励、自动生成安全训练场景的方法,以及更强的安全和监控措施。
反蒸馏、水印与欧洲合规
Anthropic同时推出针对所谓蒸馏攻击的措施。公司称,攻击者利用数千个虚假账户以工业规模提取模型能力,并在没有其安全防护的情况下构建高能力模型。Anthropic引用一份 2026 年 9 月的威胁报告,记录了其已检测并阻止的非法蒸馏活动。
Opus 5.5上线时带有“Preserved Thinking”,这是最初随Fable 5.1推出的反蒸馏措施,防止API用户编辑Claude的先前上下文来提取其推理过程。该措施适用于 2026 年 8 月 31 日及之后创建的API账户,覆盖Fable 5.1和Opus 5.5。
Opus 5.5还包含满足欧盟AI法案的水印措施。该模型不再能在关闭“Thinking”模式的情况下运行,并提供零数据保留选项。
外部测试与行业安全立场
外部机构Frontier Design和METR在发布前测试了Opus 5.5。
AI实验室正在争论多快发布能力更强的模型。OpenAI最近呼吁为可能自我改进的AI系统制定国际标准,多名研究人员则公开敦促实验室在对齐方法跟上之前放缓发布。Anthropic持类似立场,呼吁对可能完全自动化AI研究的模型设立更高的安全标准,并认为公共政策应在设定标准方面发挥更大作用。