Claude Fable 5.1 登顶 Artificial Analysis 智能指数,但每任务成本比 Fable 5 高 20%
Claude Fable 5.1 tops the Artificial Analysis Intelligence Index but costs 20% more per task than Fa…
精选理由
评测方参与预发布评估,给出多档 effort 的得分与每任务成本对比,读者可据此权衡 Claude Fable 5.1 的智能与开销。
AI 摘要
Artificial Analysis 评测 Claude Fable 5.1,其在 max effort 下得 66 分登顶 Artificial Analysis Intelligence Index。
正文 · AI 翻译
Claude Fable 5.1 登顶 Artificial Analysis 智能指数,但尽管缓存读取价格下调 75%,其单任务成本仍比 Fable 5 高出 20%
我们与 @AnthropicAI 合作,对 Claude Fable 5.1 进行了发布前评测。在最大推理强度下,它在 Artificial Analysis 智能指数上取得 66 分,这是我们测得的最高分数,领先于 Claude Opus 5(最大强度,63 分)、Claude Fable 5(最大强度,62 分)、GPT-5.6 Sol(最大强度,61 分)和 Grok 4.6(高强度,61 分)。我们使用 Anthropic 的"默认"服务端回退机制对模型进行了评测,该机制会将触发安全标记的请求路由至 Claude Opus 4.8 或 Claude Opus 5;在智能指数评测中,回退机制处理了约 4% 的输出 token。
核心要点
➤ 前沿智能水平,各基准测试均有提升:Fable 5.1 在智能指数上较 Fable 5 提升 4 分。在 HLE 上,Fable 5.1 取得 59.1% 的成绩,超过此前由 Claude Fable 5 保持的 55.5% 最佳成绩。它在 Terminal-Bench v2.1(91.4%)和 SciCode(62.0%)上取得了我们所见过的最高分(微弱领先),在 τ3-Banking 上较 Fable 5 提升 9 分
➤ 缓存读取价格下调 75%,但 Fable 5.1 的单任务成本仍然更高:Anthropic 已将缓存读取价格从每 100 万缓存输入 token 1 美元下调至 0.25 美元,标准定价保持不变,仍为每 100 万输入/输出 token 10 美元/50 美元。Fable 5.1(最大强度)在智能指数上的单任务成本为 3.76 美元,比 Fable 5(最大强度)高出 20%,原因是其输出 token 使用量约为后者的 1.7 倍。缓存价格下调使每个任务节省约 1.40 美元,这部分节省主要集中在智能体评测中,因为其中大部分输入 token 为缓存读取。在 xhigh 推理强度下,Fable 5.1 取得 65 分,单任务成本为 2.72 美元,比最大强度低 1.04 美元,但仍高于 Claude Opus 5(最大强度,63 分)的 2.34 美元
➤ Claude Fable 5.1 占据了"智能 vs 每任务输出 token"帕累托前沿的高端位置:在智能指数上得分高于 GPT-5.6 Sol (medium) 的每一个模型变体,在智能和 token 使用量两方面都会被某个 Fable 5.1 努力级别所匹配或超越
➤ 在智能体工作任务上得分最高,但与 Opus 5 实际持平:Fable 5.1 在我们所测得的智能体知识工作评测中创下最高分--GDPval-AA v2(1,853 Elo,较 Fable 5 高出 +130)和 AA-Briefcase(1,694 Elo,较 Fable 5 高出 +122)。与 Claude Opus 5 相比,GDPval-AA v2 的领先幅度在置信区间内,而 AA-Briefcase(1,685)则实际持平;Fable 5.1 在分析质量和评分标准正确性上领先,但在演示呈现方面落后
其他模型细节:
➤ 上下文窗口:100 万 token,与 Anthropic 近期发布的其他模型一致,支持图像和文本输入。
➤ 定价:Fable 5.1 保留了 Fable 5 的输入、输出和缓存写入价格,分别为每百万 token $10、$50 和 $12.5,但缓存命中价格已降至每百万 token $0.25,相对之前降低了 75%,这将显著降低智能体工作负载的成本。
原文
Original Title
Claude Fable 5.1 tops the Artificial Analysis Intelligence Index but costs 20% more per task than Fa…
Source
Artificial Analysis (@ArtificialAnlys)
Site
x.com
Published
2026-09-02 04:12