Artificial Analysis 评测 GPT-6 Sol 与 Luna:成本减半,智能指数持平
GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Lun…
精选理由
第三方实测给出 GPT-6 Sol 与 Luna 的价格减半和各基准升降明细,可帮助读者按任务成本与幻觉率选型。
AI 摘要
Artificial Analysis 评测 GPT-6 Sol 和 Luna,两模型价格约为 GPT-5.6 对应版本一半,Sol 定价 $2/$10、Luna $0.10/$0.50 每百万输入/输出 token,Intelligence Index 与 GPT-5.6 持平。
正文 · AI 翻译
GPT-6 Sol 和 Luna 将成本效率前沿向前推进,相较 GPT-5.6 Sol 和 Luna 成本减半。智能指数和编程智能体指数得分与 GPT-5.6 持平,部分评测有所进步,另一些则出现退步
定价约为 GPT-5.6 的一半:Sol 从每百万输入/输出 token 4 美元/20 美元降至 2 美元/10 美元,Luna 从 0.20 美元/1.20 美元降至 0.10 美元/0.50 美元,缓存读取仍享 90% 折扣,缓存写入仍加收 25% 溢价。
关键要点:
➤ 每任务成本减半:GPT-6 Sol(max)运行 Artificial Analysis 智能指数每任务成本为 1.06 美元,比 GPT-5.6 Sol(max)的 1.99 美元低约 50%。GPT-6 Luna(max)每任务成本为 0.07 美元,比 GPT-5.6 Luna(max)的 0.18 美元低约 60%。这主要得益于降价,因为两款模型每任务使用的输出 token 都略有增加(Sol 为 31k 对 29k,Luna 为 51k 对 41k)。这两次发布使 OpenAI 占据了成本效率帕累托前沿的相当大一部分。
➤ 在编程智能体指数中,Sol 进步但 Luna 退步:在 OpenAI 的 Codex harness 中,GPT-6 Sol(max)在 Artificial Analysis 编程智能体指数中得分 57,比 GPT-5.6 Sol(max)提升 2 分,在 Terminal-Bench 4.0(43% 对 37%)和 SWE-Atlas-QnA(58% 对 54%)上均有提升。每任务成本 2.99 美元,比 GPT-5.6 Sol(max)低约 50%,位于编程智能体指数与每任务成本的帕累托前沿上。GPT-6 Luna(max)得分 41,比 GPT-5.6 Luna(max)下降 2 分,在 SWE-Atlas-QnA(44% 对 49%)和 DeepSWE v1.1(64% 对 66%)上得分更低,每任务成本低约 60%。
➤ 模型幻觉显著减少:两款模型在 AA-Omniscience(我们的知识与模型幻觉基准)中的模型幻觉都有所降低。GPT-6 Sol(max)将其模型幻觉率从 92% 降至 60%,GPT-6 Luna(max)从 93% 降至 77%。Sol 实现这一点的方式是更频繁地拒绝作答:它尝试回答 83% 的问题,而 GPT-5.6 Sol(max)为 99%,这使错误答案减少了约四分之一,但也让准确率从 59% 下降了 5 个百分点至 54%。Luna 的准确率基本持平,为 44% 对 43%,同时它回答的问题更少。在 AA-Omniscience Index 上,Sol 从 22 提升至 27,Luna 从 -10 提升至 1。
➤ 各项评测中进步与退步并存:除 AA-Omniscience 之外,两款模型在 AutomationBench-AA(Sol 62% 对 60%,Luna 53% 对 50%)和 Terminal-Bench 4.0(Sol 44% 对 40%,Luna 13% 对 12%)中均有提升。然而,我们在两项关键的知识工作评测中观察到退步。在 GDPval-AA v2.1 中--这是我们基于 OpenAI 数据集改编的基准,涵盖 44 种职业中具有经济价值的任务--Sol 下降约 100 Elo 分,Luna 下降约 75 分。Luna 在 AA-Briefcase v1.1 中也下降约 45 Elo 分,而 Sol 持平。AA-Briefcase v1.1 是一项针对跨越多周的知识工作项目的私有评测,包含数千个输入文件。我们的团队已人工检查了数百个模型输出:这些退步往往源于呈现质量下降,以及交付成果遗漏了评分标准中的要素。
祝贺 @OpenAI 和 @sama 发布!
原文
Original Title
GPT-6 Sol and Luna push the cost efficiency frontier by halving cost relative to GPT-5.6 Sol and Lun…
Source
Artificial Analysis (@ArtificialAnlys)
Site
x.com
Published
2026-09-23 02:20