Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1,运行成本比 Opus 5 低 40%
Anthropic Releases Claude Opus 5.5: Fable 5.1-Level Performance at 40% Lower Running Cost Than Opus 5
精选理由
原文汇总了 Opus 5.5 的基准成绩、价格降幅和 API 限制变化,读者可据此评估是否迁移现有工作负载。
AI 摘要
Anthropic 发布 Claude 5.5 家族首个模型 Claude Opus 5.5,称其在多数工作上达到 Fable 5.1 水平,典型工作负载运行成本比 Opus 5 低 40%,输出速度快 30% 以上。
正文 · AI 翻译
Anthropic 发布了 Claude Opus 5.5,这是其全新 Claude 5.5 系列中的首个模型。团队表示,它在大多数工作上的表现达到了 Claude Fable 5.1 的水平。在默认设置下,它在典型工作负载上的运行成本也比 Opus 5 低 40%。在 Anthropic 自家的基准测试中,它在智能体编程、计算机使用和知识工作方面均处于领先地位。
可以部署吗?可以,作为托管 API 模型部署。Anthropic 未发布权重,因此无法自行托管。开发者可以在claude-opus-5-5上调用Claude Platform, Amazon Web Services, Google Cloud以及Microsoft Azure。与之前的 Opus 模型一样,支持零数据保留。
基准测试:领先优势明显,但并非全面碾压
Opus 5.5 的得分在最大努力下采用自适应思考,并启用了生产环境防护措施。
基准测试Opus 5.5Fable 5.1Opus 5GPT-6 Astra
Terminal-Bench 4.066.4%55.8%52.3%57.9%
FrontierCode v1.154.4%50.3%48.0%53.3%
CursorBench 4.057.8%51.8%46.6%n/r
GDPval-AA v2.1 (Elo)1846173517081542
OSWorld 2.081.8%80.7%74.0%n/r
Terminal-Bench-Science 0.158.7%52.6%29.0%64.6%
AutomationBench40.0%31.4%26.9%41.4%
Terminal-Bench 4.0 报告的是 Opus 5.5 在 xhigh 努力程度下的成绩。GPT-6 Astra 仍在 Terminal-Bench-Science 和 AutomationBench 上领先。
Zapier 在运行 AutomationBench 时未使用回退模型,因此安全防护干预被计为失败。Anthropic 也提醒称,基准测试的领先幅度正变得越来越不可靠。在其自身使用中,与 Fable 5.1 的差距比分数所显示的更小。
经成本调整后的结果更能说明问题。在默认(中等)努力程度下,Opus 5.5 在 FrontierCode 上得分 54.6%。这超过了 GPT-6 Astra 的最高分 53.3%,而每任务成本约为其五分之一。在 CursorBench 上,中等努力程度得分为 52.5%。这比 GPT-5.6 Sol 的最佳成绩高出 11 分,而成本约为其三分之一。
定价与速度
Opus 5.5 的推理服务所需算力低于 Opus 5,定价也反映了这一点。
每 1M tokensOpus 5.5Opus 5
输入$4$5
输出$20$25
缓存读取$0.20$0.50
缓存写入$5$6.25
缓存读取占据了智能体和编程成本的绝大部分,而它们下降了 60%。Opus 5.5 每项任务使用的 token 也更少。两者相加,净效果就是 40% 的成本降低。输出生成比 Opus 5 快 30% 以上。Claude Code 和 Claude Platform 中的快速模式可提供最高 2.5 倍的速度,价格为每百万 token 输入 $8、输出 $40。
Anthropic 还提高了 Pro、Max、Team 以及按席位计费的 Enterprise 套餐的五小时使用限额。订阅用户可获得一次速率限制重置,可保存下来日后使用。
早期测试者的反馈
一位测试者在不到一天内完成了 680,000 行的代码迁移。
另一位测试者在 3 小时内审计并修复了一个 200,000 行的代码库。Opus 5 则花了 20 多个小时,且 token 用量是 2.5 倍。
在一次内部的 HAProxy 从 C 到 Rust 的移植中,Opus 5.5 在 9.5 小时内完成。Fable 5.1 花了 12 小时,而 Opus 5.5 的成本低了 51%。
Deloitte 表示,Opus 5.5 在最低努力程度下捕获了 72% 的已知审查缺陷。Opus 5 在高努力程度下捕获了 56%。
在一项难以获取来源的财报测试中,18 份 Opus 5.5 报告中有 16 份达到了 Anthropic 的质量标准。Fable 5.1 和 Opus 5 则从未达标。
写作风格也发生了变化。Opus 5.5 会把关键信息放在前面,使用更少的行话,并遵循你给它的写作规则。
安全、防护措施与 API 变更
Opus 5.5 是 Anthropic 自 CEO Dario Amodei 呼吁为前沿技术发展设定节奏以来的首个发布版本。包括 METR 和 Frontier Design 在内的外部评估方在发布前对其进行了测试。它在 Anthropic 的自动化行为审计中取得了迄今为止的最佳成绩,该审计涵盖近 2,000 个场景。在一项新的隔离测试中,它试图绕过边界的频率比 Opus 5 低约 85%。Anthropic 还指出,该模型经常怀疑自己正在被评估。
其生物学和网络能力与 Claude Mythos 5.1 相当。因此 Opus 5.5 随附了与 Fable 5.1 类似的防护措施:
网络安全:常规的漏洞发现与修复可以正常工作。大多数其他网络安全任务会被重新路由至 Opus 4.8。网络验证计划将扩展至 Opus 5.5。
生物学:经过审核的组织可以申请加入生命科学验证计划。
知识蒸馏:保留思考功能阻止 API 用户编辑先前的上下文以提取推理过程。该功能适用于 2026 年 8 月 31 日或之后创建的 API 账户。
还有两项变更影响集成。思考功能不再能被禁用。输出还带有水印,以符合欧盟《人工智能法案》。完整细节见Opus 5.5 系统卡。
交互式解读
核心要点
Opus 5.5 在大多数工作上与 Fable 5.1 相当,并且在几乎所有已报告的基准测试中都同时胜过 Opus 5 和 Fable 5.1。
API 价格降至每 1M tokens 4 美元/20 美元,缓存读取费用下降 60% 至 0.20 美元。
Anthropic 估计典型工作负载可节省 40%,输出速度比 Opus 5 快 30% 以上。
网络与生物学相关请求会触发 Fable 5.1 级别的安全防护,且思考功能无法关闭。
闭源权重:claude-opus-5-5 通过 Claude Platform、AWS、Google Cloud 和 Azure 运行。
原文
Original Title
Anthropic Releases Claude Opus 5.5: Fable 5.1-Level Performance at 40% Lower Running Cost Than Opus 5
Source
MarkTechPost(RSS)
Site
marktechpost.com
Author
Asif Razzaq
Published
2026-09-23 02:59