返回 AI 情报
模型精选 812026-09-04 05:16Asif RazzaqMarkTechPost(RSS)

OpenAI 发布 GPT-6 Astra:1.05M 上下文的计算机操作模型,因触及 Critical 网络安全阈值而限制访问

OpenAI Releases GPT-6 Astra: A 1.05M-Context Computer-Use Model Gated Behind a 'Critical' Cyber Threshold

精选理由

原文汇总了模型规格、多组基准对比和访问限制细节,并指出 ARC-AGI-3 与编码成绩的解读前提。

AI 摘要

OpenAI 发布 GPT-6 Astra,定位为计算机操作模型,提供 1,050,000 token 上下文窗口、128,000 最大输出 token,2026 年 4 月 30 日知识截止,OSWorld V2-Offline 得分 72.6%(GPT-5.6 Sol 为 65.7%),平均任务时间从约 75 分钟降至 40 分钟。

正文 · AI 翻译

今天,OpenAI 发布了 GPT-6 Astra。该公司称这是其最智能、对齐程度最高的模型,并将其定位为以计算机操作为核心的系统,而非聊天模型。其卖点在于,Astra 能像人一样操作软件,横跨浏览器、电子表格、桌面应用和终端,直接完成多步骤任务,而不是描述该怎么做。

它能否部署?部分可以,但不能部署在你自己的硬件上。Astra 是一个封闭的托管模型,未开放权重,因此无法自托管。目前它仅对 OpenAI Trusted Access 和 Daybreak 项目中的组织开放。

真正的新变化是什么

对开发者而言,主要变化在于上下文处理。Codex 此前采用压缩机制,在上下文占满后对较早的对话轮次进行摘要。这一过程会丢弃智能体后续需要的细节:某个修复为何失败、运行了哪些测试、早期添加了哪项需求。Astra 则会在上下文窗口之间保留笔记,并回溯搜索更早的消息和工具输出。该功能以实验性形式随 config.toml 设置推出,并将在未来几周内成为 Codex 的默认行为。

Astra 还可以在继续执行不依赖答案的工作的同时向用户提问。这消除了智能体常见的一种失败模式——一个悬而未决的决策导致整个任务停滞。

在模型页面,Astra 列出了 1,050,000 token 的上下文窗口、128,000 的最大输出 token,以及 2026 年 4 月 30 日的知识截止日期。输入支持文本和图像,输出仅支持文本。reasoning.effort 在 high 之上新增了两个级别:xhigh 和 max。工具支持涵盖计算机使用、托管 shell、应用补丁、技能、MCP 和工具搜索。不支持微调。

基准测试概览

OpenAI 报告在 OSWorld V2-Offline 上取得 72.6% 的成绩,而 GPT-5.6 Sol 为 65.7%,平均任务耗时从约 75 分钟降至 40 分钟。Anthropic 报告 Claude Fable 5.1 取得 77.9% 的成绩,但表示其使用了不同的 OSWorld 版本,不应直接进行比较。

Astra 在 ARC-AGI-3 上得分 98.6%。该数字是通过 Responses API 测试框架得出的,该框架在轮次之间保留推理过程,并对长上下文使用压缩处理,而 OpenAI 此前已表明,这些设置可以在不改变模型的情况下显著影响 ARC-AGI-3 的得分。因此,该结果衡量的是模型加智能体系统的整体表现。

其他已报告的数据:FrontierMath Tier 4 得分 97.6%,BenchCAD Vision2Code 得分 95.9%(Fable 5.1 为 84.3%),Terminal-Bench Science 得分 64.6%(Anthropic 报告为 52.6%)。Epoch AI 指出,OpenAI 资助了 FrontierMath,并对其部分内容拥有独家访问权。

编程是这套叙事中的薄弱环节。Astra 在 DeepSWE v1.1 上得分 74.1%,而 Sol 为 70.8%。Meta 报告 Muse Spark 1.3 在最大推理强度下得分 75.4%,公开排行榜显示 Gemini 3.8 Flash 和 Claude Opus 5 接近 74%。在 113 项任务的基准测试中,这些差距仅为一到两个任务的差别。

网络能力驱动访问模式

Astra 是 OpenAI 在其 Preparedness Framework 中首个被认定为达到“关键网络安全”门槛的模型。在测试中,它成功开发出针对加固浏览器和操作系统的漏洞利用,并发现了两个此前未知的 V8 漏洞,OpenAI 表示将向维护方披露这些漏洞。

其影响是实际性的。标准访问权限会拒绝高级网络安全工作,包括漏洞发现。对于 API 开发者而言,网络安全安全检查会直接终止任务,而不是暂停等待批准。OpenAI 的 Mia Glaese 警告称,未加入可信访问计划的用户可能会遇到速度下降、暂停或阻断,有时甚至发生在无关工作中。

OpenAI 报告 Astra 在 ExploitBench 上达到 100%,这是一个综合能力覆盖率分数而非通过率;在 ExploitGym 上达到 42.4%,而 Sol 为 30.3%,两者均移除了通常的六小时时间限制。

定价

Astra 的价格为每百万输入 token 10 美元,每百万输出 token 50 美元,缓存输入为 1.00 美元。输入超过 272K token 的请求,将对整个请求按输入 2 倍、输出 1.5 倍计费。Batch 和 Flex 模式按 50% 计费,Fast 模式按 2 倍计费。Pro、Business 和 Enterprise 用户还可获得 Astra Pro。

关键要点

Astra 首先是一款计算机使用模型:OSWorld V2-Offline 得分 72.6%,任务时间从约 75 分钟降至约 40 分钟。

笔记取代了 Codex 中的压缩机制,因此长时间运行的智能体不再丢失失败细节。

编码能力提升幅度有限:74.1% 的 DeepSWE v1.1 成绩处于排行榜中游水平。

首个达到 OpenAI“关键”网络威胁门槛的模型;标准访问权限拒绝漏洞利用相关工作。

不开放权重,每百万 token 收费 10/50 美元,上下文窗口 1.05M,API 与 AWS 即将在未来数日内上线。

欢迎查看 OpenAI 官方公告、OpenAI 在 X 平台上的动态以及 GPT-6 Astra 模型页面。此外,欢迎在 Twitter 上关注我们,别忘了加入我们拥有 15 万+成员的 ML SubReddit,并订阅我们的 Newsletter。等等!你在用 Telegram 吗?现在你也可以在 Telegram 上找到我们了。

原文

Original Title

OpenAI Releases GPT-6 Astra: A 1.05M-Context Computer-Use Model Gated Behind a 'Critical' Cyber Threshold

Source

MarkTechPost(RSS)

Site

marktechpost.com

Author

Asif Razzaq

Published

2026-09-04 05:16

阅读原文· marktechpost.com

继续阅读