返回 AI 情报
模型精选 822026-09-23 02:00OpenAI:官网动态(RSS · 排除企业/客户案例)

OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 降 50%

Introducing GPT-6 Sol and Luna

精选理由

官方发布给出各档模型的具体基准分数、API 价格降幅和缓存改进数据,可以用来对比 GPT-6 家族在成本与能力之间的取舍。

AI 摘要

OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,将 GPT-6 Astra 的训练方法用于更快更便宜的模型,API 价格较 GPT-5.6 促销价下调 50%(Sol 输入 $4→$2、输出 $20→$10;Luna 输入 $0.20→$0.10、输出 $1.20→$0.50,每百万 token)。

正文 · AI 翻译

将前沿智能融入你日常工作的更多方式。

本月早些时候,我们推出了 GPT‑6 Astra,这是全球最智能、对齐程度最高的模型。尽管最严苛、最重要的项目仍然需要 Astra 的完整深度,但工作会以不同的规模、节奏和预算发生。

正因如此,我们通过 GPT‑6 Sol 和 GPT‑6 Luna 扩展了 GPT‑6 宇宙。GPT‑6 Astra 开启了新一代智能——这些模型通过在成本效率上推进前沿,帮助将这种智能的益处更广泛地分配。我们使用与 GPT‑6 Astra 类似的方法训练了 GPT‑6 Sol 和 Luna,将 Astra 在专业工作、事实性、编程、计算机使用和对齐方面取得最先进性能背后的进步,带到了更快、更实惠的模型中。

GPT‑6 系列模型在成本—智能曲线上全面领先,在每个层级都具备卓越能力,并配有能够高效大规模交付这些能力的基础设施。缓存和推理方面的改进让我们能够以更低的成本提供这些模型,我们通过 将 Sol 和 Luna 的 API 价格相较其 GPT‑5.6 促销定价下调 50%,将这些节省直接传递给用户和客户。这些改进共同让先进 AI 在更多日常任务和大规模应用中变得切实可行。

GPT‑6 API 定价

模型

输入

输出

降价

GPT‑6 Sol 对比 GPT‑5.6 Sol

$4 → $2

$20 → $10

便宜 50%

GPT‑6 Luna 对比 GPT‑5.6 Luna

$0.20 → $0.10

$1.20 → $0.50

便宜 50%

价格按每 100 万 tokens 计。

GPT‑6 Astra 依然是我们全方位表现最佳的模型。当你想要最佳结果和不妥协的体验时,选择它。

整个模型系列全面升级

GPT‑6 Sol 和 Luna 为你已经熟悉并使用的模型带来智能升级和成本效率,覆盖对完成复杂工作最有用的各项能力。

专业工作

GPT‑6 Sol 能够承担困难的工作任务,同时凭借更高的使用限额和更低的成本,为你留出更多迭代空间,相比价格相近的竞品模型提供更强的智能和更好的结果。

在 AutomationBench 这一跨应用业务工作流测试中,GPT‑6 Sol 在 xhigh 努力程度下,以仅为 Claude Opus 5 在 max 努力程度下每任务成本 9% 的开销,超越了后者。在 high 努力程度下,GPT‑6 Luna 相比其前代提升 5.4 个百分点,每任务成本降低 58%。

媒体内容 · 前往原文查看

在 AutomationBench 1.0.6⁠ 中,AI 智能体在涵盖销售、营销、运营、支持、财务和人力资源的端到端工作流上接受测试,使用 47 种工具。Claude Fable 5.1 的数据点低估了其实际成本,因为它未计入 Opus 5 回退的成本,而这类回退在约 40% 的任务中出现。

GPT‑6 Sol 也以远更低的成本超越 Claude Fable 5.1,甚至胜过低努力程度的 GPT‑6 Astra。

模型(及努力程度)

得分

每任务成本

GPT‑6 Sol(xhigh)

33.2%

$0.27

GPT‑6 Astra(low)

30.3%

3.9x GPT‑6 Sol

Claude Opus 5(max)

26.9%

11.1x GPT‑6 Sol

Claude Fable 5.1 搭配 Opus 5 回退(max)

31.4%

>8.9x GPT‑6 Sol

(未报告回退成本)

在 Agents’ Last Exam 上,该评测考察智能体在复杂专业工作流中的表现,GPT‑6 Sol 在 max effort 下得分 56.4%,高于 Claude Opus 5 在该评测中的最高分,且每任务成本低 60%。

媒体内容 · 前往原文查看

在Agents’ Last Exam V1⁠中,AI 智能体在跨越 55 个子行业、涵盖计算机上大多数主要专业工作领域的长期、具有经济价值的任务上接受评估。

事实性

答案的有用性取决于事实是否正确,我们正在事实可靠性方面持续取得进展。在我们的内部事实性评估中——该评估基于经过脱敏的真实世界对话,其中用户标记了我们模型所犯的错误——GPT‑6 Sol 所犯的错误约为其前代的一半,以低得多的成本接近 Astra 级别的可靠性。GPT‑6 Luna 也有大幅提升;在更高的 effort 水平下,它以约百分之一的成本达到 GPT‑5.6 Sol 的水平。

媒体内容 · 前往原文查看

在此,我们基于经过脱敏处理的 ChatGPT 对话来评估事实性,这些对话中用户曾标记过此前某个模型出现的事实错误。这些诱发错误的对话并不代表典型使用场景,在典型使用中事实错误更为罕见。评分未对长度进行控制;不过,我们的冗长度扫描显示,答案长度几乎不产生影响。

编程

今年,编程智能体开始处理比以往任何时候都更复杂、范围更大、持续时间更长的任务。在 OpenAI,我们的内部使用量呈指数级增长。按 API 价格计算,每日 token 用量中位数研究员已超过 $600,第 90 百分位的研究员则超过 $7,000(研究加速:OpenAI 内部视角)。随着编程智能体承担更长、要求更高的任务,持续使用的成本变得更加重要。GPT‑6 Sol 和 Luna 将强大的编程性能与更低的 API 价格相结合,让开发者有更多空间进行迭代,也让团队有信心对 Codex 提出更宏大的要求。

在 FrontierCode 上——该基准评估编程智能体生成的改动是否已准备好合并进真实代码库——GPT‑6 Sol 相比 GPT‑5.6 Sol 有大幅提升,并且能够以低得多的成本匹配 Claude Fable 5.1 xhigh。

媒体内容 · 前往原文查看

在 FrontierCode 1.1 Main⁠ 中,AI 智能体编写的代码不仅按正确性评分,还按“可合并性”评分:例如测试质量、范围纪律、代码风格以及对代码库标准的遵循程度。

在 DeepSWE v1.1 上,该基准测试在真实代码库中完成复杂软件工程任务的性能,GPT‑6 Sol 在最大努力下得分 68.8%,与 Claude Fable 5 在该评测中的最高分——xhigh 努力下的 69.9%——相差 1.1 个百分点,而每任务成本约低 80%。

GPT‑6 Luna 在最大努力档位下得分 66.6%,与 Claude Opus 5 和 Fable 5 在中等努力档位下的表现相当。在这些对比中,Luna 每项任务的成本比 Opus 5 低 93%,比 Fable 5 低 96%。

媒体内容 · 前往原文查看

在 DeepSWE 1.1⁠中,AI 智能体解决原创的、长时程软件工程任务。

计算机使用

尽管 GPT‑6 Astra 仍是全球最强的计算机使用模型,GPT‑6 Sol 和 Luna 相比前代产品提供了更具成本效益的性能。在 OSWorld 2.0 离线上,GPT‑6 Sol 在 xhigh 努力档位下取得了与 Claude Opus 5 在中等努力档位下相近的分数——60.5% 对 60.3%——而每项任务成本约低 80%。GPT‑6 Luna(max)能够以 GPT‑5.6 Sol(medium)十分之一的成本超越后者。

媒体内容 · 前往原文查看

在 OSWorld 2.0⁠中,AI 智能体尝试跨越日常与专业任务的长时程计算机使用工作流。我们报告的是 v2026.08.08 版本离线集上的部分奖励。

协作风格

我们还将 GPT‑6 Astra 改进后的沟通风格带到了 Sol 和 Luna,我们认为这在技术和编程对话中会尤为明显。可以期待更清晰的表达、更少的术语、更少奇怪的措辞、更少低价值的细节,以及整体上略微更简短的回答,同时不损失实质内容。

媒体内容 · 前往原文查看

提示词

网站看起来挺清爽的!我们能不能用便当盒(Bento Box)设计风格,并在右上角的页面之间加一个滑块?你可能需要深入用一下 React……

GPT-5.6 Sol

当然可以。我无需引入 React 就能实现便当盒的观感和右上角的滑动页面切换器——这个交互足够小,可以在当前网站中保持快速流畅。我现在正围绕这套系统重新塑造全部四个页面。

完成了——打开线上网站看看。

现在全部四个页面都采用了色彩丰富的便当盒布局,右上角还有一个带动画的 Home / Play / Place / Taste 滑块。并不需要 React;原生页面过渡让它保持轻量而流畅。

内置图像工具创作了这些食物插画。提示词:“一幅充满活力的水粉与水墨风格的编辑插画,赞美饺子和辣面,色彩明亮,有蒸汽、香料,不含任何文字或标志。”

GPT-6 Sol

我会把这些页面改造成便当盒网格布局,并把右上角的链接变成一个可滑动的页面切换器。我会保留现有站点,并在改动其设置之前先确认这个交互是否需要用到 React。

更新后的站点已经上线。现在每个页面都采用了活泼的便当盒布局,右上角的页面切换器可以在各个板块之间滑动切换。我在桌面端和窄屏移动端都做了检查,包括浏览器的后退导航。现有站点这次并不需要用到 React。

尽管风格是主观的,但我们在这里更偏好 GPT‑6 Sol 的回复。它不会那么快地下结论,花更少时间反复赘述提问者可能已经显而易见的细节(例如该网站有四个页面),使用更少含糊的措辞(例如“便当盒感”、“围绕那套系统进行改造”),更坦率地说明自己检查了什么、没检查什么,也不会不必要地分享诸如其图像工具提示词之类的实现细节。

为智能体和长对话改进缓存

在降低 token 价格的同时,我们也在帮助基于 GPT‑6 构建的开发者,在应用复用上下文时节省更多成本。我们改进了 GPT‑6 的提示词缓存,默认带来更高的缓存命中率,帮助智能体复用更多上下文、更快响应,并享受缓存输入 token 读取 90% 的折扣。

开发者还有更多方式来衡量和优化其缓存性能:

监控与诊断。提示词缓存仪表盘⁠会显示有多少输入被缓存,以及这一数值随时间的变化。诊断工具⁠有助于解释错失的缓存机会以及需要修复的地方。

调整推理力度和工具可用性,而不破坏缓存。对于更难的任务,可以提高推理力度⁠,对于更简单的后续任务则可以降低;随着智能体需求的变化,还可以启用或禁用工具⁠。现在这两项控制都会保留更早的上下文,以供缓存复用。

优化哪些前缀会被缓存。显式断点让开发者可以选择缓存提示词前缀的结束位置。这让开发者对缓存复用拥有更多控制权,并可以提升性能。

GitHub 报告称,在过去几个月里,这些改进使 OpenAI 模型收到的数十亿次请求中,需要全新处理的提示词 token 占比降低了 50% 以上,从而帮助 Copilot 更快响应。

持续改进对齐

GPT‑6 Sol 和 Luna 建立在 Astra 所引入的对齐工作之上,Astra 是我们迄今为止对齐程度最高的模型。在我们的对齐评估中,Sol 和 Luna 相比各自的 GPT‑5.6 对应版本均有所改进,包括降低了就其编码工作做出误导性陈述的比例。

以下评估刻意测试具有挑战性的情境,并不衡量典型使用场景下的失败率。完整结果请参见系统卡⁠。

媒体内容 · 前往原文查看

在我们的内部编码欺骗评估中,AI 智能体被赋予刻意挑选、旨在诱发不诚实行为的任务。在典型使用中,欺骗行为要罕见得多。欺骗率衡量的是检测到任何欺骗行为的回答所占的比例。推理投入(Effort)设置为最大。

可用性

GPT‑6 Sol 和 GPT‑6 Luna 从今天起在 ChatGPT Work 和 Codex 中面向所有 Plus、Pro、Business、Enterprise 和 Edu 用户开放。Free 和 Go 用户可在桌面应用中访问 GPT‑6 Luna。这些模型尚未在 Chat 中提供。在 OpenAI API 中,它们以 gpt-6-sol 和 gpt-6-luna 的形式提供。

为了保持对所有人的服务稳定,我们计划在一天内逐步在 ChatGPT 中推出这些模型。如果你在 ChatGPT Work 或 Codex 中看不到新模型,请稍后再试。

GPT 的评估是在我们的研究环境中或通过我们的 API 进行的,由于系统提示词、可用工具等方面的差异,其输出可能与生产环境中的 ChatGPT 略有不同。竞品模型的评估取自公开报告。在无法获得 Claude Fable 5.1 的分数时,报告的是 Claude Fable 5 的分数。

原文

Original Title

Introducing GPT-6 Sol and Luna

Source

OpenAI:官网动态(RSS · 排除企业/客户案例)

Site

openai.com

Published

2026-09-23 02:00

阅读原文· openai.com

继续阅读

OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 降 50% - AI 情报频道 - 小黑丸