返回 AI 情报
模型精选 842026-09-23 02:59Asif RazzaqMarkTechPost(RSS)

Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1,运行成本比 Opus 5 低 40%

Anthropic Releases Claude Opus 5.5: Fable 5.1-Level Performance at 40% Lower Running Cost Than Opus 5

精选理由

原文汇总了 Opus 5.5 的基准成绩、价格降幅和 API 限制变化,读者可据此评估是否迁移现有工作负载。

AI 摘要

Anthropic 发布 Claude 5.5 家族首个模型 Claude Opus 5.5,称其在多数工作上达到 Fable 5.1 水平,典型工作负载运行成本比 Opus 5 低 40%,输出速度快 30% 以上。

正文 · AI 翻译

Anthropic 发布了 Claude Opus 5.5,这是其全新 Claude 5.5 系列中的首个模型。团队表示,它在大多数工作上的表现达到了 Claude Fable 5.1 的水平。在默认设置下,它在典型工作负载上的运行成本也比 Opus 5 低 40%。在 Anthropic 自家的基准测试中,它在智能体编程、计算机使用和知识工作方面均处于领先地位。

可以部署吗?可以,作为托管 API 模型部署。Anthropic 未发布权重,因此无法自行托管。开发者可以在claude-opus-5-5上调用Claude Platform, Amazon Web Services, Google Cloud以及Microsoft Azure。与之前的 Opus 模型一样,支持零数据保留。

基准测试:领先优势明显,但并非全面碾压

Opus 5.5 的得分在最大努力下采用自适应思考,并启用了生产环境防护措施。

基准测试Opus 5.5Fable 5.1Opus 5GPT-6 Astra

Terminal-Bench 4.066.4%55.8%52.3%57.9%

FrontierCode v1.154.4%50.3%48.0%53.3%

CursorBench 4.057.8%51.8%46.6%n/r

GDPval-AA v2.1 (Elo)1846173517081542

OSWorld 2.081.8%80.7%74.0%n/r

Terminal-Bench-Science 0.158.7%52.6%29.0%64.6%

AutomationBench40.0%31.4%26.9%41.4%

Terminal-Bench 4.0 报告的是 Opus 5.5 在 xhigh 努力程度下的成绩。GPT-6 Astra 仍在 Terminal-Bench-Science 和 AutomationBench 上领先。

Zapier 在运行 AutomationBench 时未使用回退模型,因此安全防护干预被计为失败。Anthropic 也提醒称,基准测试的领先幅度正变得越来越不可靠。在其自身使用中,与 Fable 5.1 的差距比分数所显示的更小。

经成本调整后的结果更能说明问题。在默认(中等)努力程度下,Opus 5.5 在 FrontierCode 上得分 54.6%。这超过了 GPT-6 Astra 的最高分 53.3%,而每任务成本约为其五分之一。在 CursorBench 上,中等努力程度得分为 52.5%。这比 GPT-5.6 Sol 的最佳成绩高出 11 分,而成本约为其三分之一。

定价与速度

Opus 5.5 的推理服务所需算力低于 Opus 5,定价也反映了这一点。

每 1M tokensOpus 5.5Opus 5

输入$4$5

输出$20$25

缓存读取$0.20$0.50

缓存写入$5$6.25

缓存读取占据了智能体和编程成本的绝大部分,而它们下降了 60%。Opus 5.5 每项任务使用的 token 也更少。两者相加,净效果就是 40% 的成本降低。输出生成比 Opus 5 快 30% 以上。Claude Code 和 Claude Platform 中的快速模式可提供最高 2.5 倍的速度,价格为每百万 token 输入 $8、输出 $40。

Anthropic 还提高了 Pro、Max、Team 以及按席位计费的 Enterprise 套餐的五小时使用限额。订阅用户可获得一次速率限制重置,可保存下来日后使用。

早期测试者的反馈

一位测试者在不到一天内完成了 680,000 行的代码迁移。

另一位测试者在 3 小时内审计并修复了一个 200,000 行的代码库。Opus 5 则花了 20 多个小时,且 token 用量是 2.5 倍。

在一次内部的 HAProxy 从 C 到 Rust 的移植中,Opus 5.5 在 9.5 小时内完成。Fable 5.1 花了 12 小时,而 Opus 5.5 的成本低了 51%。

Deloitte 表示,Opus 5.5 在最低努力程度下捕获了 72% 的已知审查缺陷。Opus 5 在高努力程度下捕获了 56%。

在一项难以获取来源的财报测试中,18 份 Opus 5.5 报告中有 16 份达到了 Anthropic 的质量标准。Fable 5.1 和 Opus 5 则从未达标。

写作风格也发生了变化。Opus 5.5 会把关键信息放在前面,使用更少的行话,并遵循你给它的写作规则。

安全、防护措施与 API 变更

Opus 5.5 是 Anthropic 自 CEO Dario Amodei 呼吁为前沿技术发展设定节奏以来的首个发布版本。包括 METR 和 Frontier Design 在内的外部评估方在发布前对其进行了测试。它在 Anthropic 的自动化行为审计中取得了迄今为止的最佳成绩,该审计涵盖近 2,000 个场景。在一项新的隔离测试中,它试图绕过边界的频率比 Opus 5 低约 85%。Anthropic 还指出,该模型经常怀疑自己正在被评估。

其生物学和网络能力与 Claude Mythos 5.1 相当。因此 Opus 5.5 随附了与 Fable 5.1 类似的防护措施:

网络安全:常规的漏洞发现与修复可以正常工作。大多数其他网络安全任务会被重新路由至 Opus 4.8。网络验证计划将扩展至 Opus 5.5。

生物学:经过审核的组织可以申请加入生命科学验证计划。

知识蒸馏:保留思考功能阻止 API 用户编辑先前的上下文以提取推理过程。该功能适用于 2026 年 8 月 31 日或之后创建的 API 账户。

还有两项变更影响集成。思考功能不再能被禁用。输出还带有水印,以符合欧盟《人工智能法案》。完整细节见Opus 5.5 系统卡。

交互式解读

核心要点

Opus 5.5 在大多数工作上与 Fable 5.1 相当,并且在几乎所有已报告的基准测试中都同时胜过 Opus 5 和 Fable 5.1。

API 价格降至每 1M tokens 4 美元/20 美元,缓存读取费用下降 60% 至 0.20 美元。

Anthropic 估计典型工作负载可节省 40%,输出速度比 Opus 5 快 30% 以上。

网络与生物学相关请求会触发 Fable 5.1 级别的安全防护,且思考功能无法关闭。

闭源权重:claude-opus-5-5 通过 Claude Platform、AWS、Google Cloud 和 Azure 运行。

原文

Original Title

Anthropic Releases Claude Opus 5.5: Fable 5.1-Level Performance at 40% Lower Running Cost Than Opus 5

Source

MarkTechPost(RSS)

Site

marktechpost.com

Author

Asif Razzaq

Published

2026-09-23 02:59

阅读原文· marktechpost.com

继续阅读