Artificial Analysis 评测 Grok 4.7:智能指数得分 46,编码智能体指数升至 56
Grok 4.7 scores 46 on the Artificial Analysis Intelligence Index to bring SpaceXAI into the top 4 AI…
精选理由
评测方给出了 Grok 4.7 在智能指数和编码智能体上的具体得分与代价比,可据此对照其他前沿模型权衡选用。
AI 摘要
Artificial Analysis 发布 Grok 4.7 评测,其在 Artificial Analysis Intelligence Index 得分 46,较 Grok 4.6 高 2 分,使 SpaceXAI 进入前四大 AI 实验室。
正文 · AI 翻译
Grok 4.7 在 Artificial Analysis Intelligence Index 上得分 46,将 SpaceXAI 带入前 4 大 AI 实验室之列。Coding Agent Index 表现也有所提升,超越了 GPT-5.6 Sol
Grok 4.7 在 Intelligence Index 上比 Grok 4.6 高出 +2 分,在智能体知识工作任务上表现强劲。我们在 xhigh 推理强度下评估了这款新模型。
祝贺 @SpaceXAI 和 @ElonMusk 发布!
核心要点:
➤ Grok 4.7 跻身智能体知识工作前沿:Grok 4.7 在 AA-Briefcase(我们用于长时程智能体知识工作的私有基准)上比 Grok 4.6(high)提升 +111 Elo,得分 1657 Elo,与 Claude Opus 5 和 Claude Fable 5.1 一同位列前沿。在 GDPval-AA 上,它得分 1695 Elo,领先 Grok 4.6(high)+90。
➤ 编码智能体性能的飞跃:Grok 4.7(xhigh)搭配 Grok Build 在 Artificial Analysis Coding Agent Index 上得分 56,比 Grok 4.6(xhigh)提升 +9 分。在原生 harness 中的模型里,Grok 4.7 + Grok Build 目前排名第 4,仅次于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。
➤ 其他方面的渐进式性能变化:在智能体知识工作之外,Grok 4.7 在 Intelligence Index 的其他任务上大体与 Grok 4.6(high)持平。它在 Terminal-Bench 4.0(+4.5 个百分点)和 GDP.pdf(+3.0 个百分点)上有所提升,但在 AA-LCR(-3.7 个百分点)和 AutomationBench-AA(-1.1 个百分点)上出现退步。
➤ 任务中 token 使用量偏高:Grok 4.7 的性能提升伴随着更高的 token 消耗。Grok 4.7(xhigh)在每项 Intelligence Index 任务中约使用 81k 输出 token,而 Grok 4.6(high)为 36k,GPT-6 Astra(max)为 27k--分别多出 125% 和 196%。
其他模型细节:
➤ 上下文窗口为 500k token,与 Grok 4.6 保持一致
➤ 定价为每 1M 输入/输出 token 2 美元/6 美元,缓存命中可享受折扣,降至每 1M token 0.50 美元,与 Grok 4.6 相同
➤ 可配置的推理强度从 low 到 xhigh。我们的评估使用 xhigh。
原文
Original Title
Grok 4.7 scores 46 on the Artificial Analysis Intelligence Index to bring SpaceXAI into the top 4 AI…
Source
Artificial Analysis (@ArtificialAnlys)
Site
x.com
Published
2026-09-22 00:38