OpenAI 发布内部研究加速报告:已达成自动化研究实习生目标,推进 2028 年 3 月自动化 AI 研究员
Research acceleration: The view inside OpenAI
精选理由
OpenAI 以内部数据披露 coding agent 对研究工作的实际影响和 RSI 进展,读者可以据此了解前沿实验室的自动化研究现状。
AI 摘要
OpenAI 发文披露自动化研究进展,宣布已达成去年秋天设定的今年 9 月拥有自动化研究实习生(可在人类指导下完成耗时数天的明确研究任务)的目标,并计划在 2028 年 3 月前造出自动化 AI 研究员。
正文 · AI 翻译
为了让 AGI 惠及全人类,我们认为它必须由民主方式治理。这只能通过公众对高能力 AI 系统的能力、风险与保障措施进行充分知情的辩论来实现。世界各地的人们都需要了解前沿 AI 可能的未来轨迹,以便在其发展过程中拥有有意义的发言权。
对具体风险、事件和保障措施的透明是必要的,但还不够。我们认为,公众还需要了解最强大的系统是如何发展的,以及它们如何在前沿实验室内部推动研究进展。
我们的目标是安全地构建一个自动化 AI 研究员,它可以在人类监督下工作,以进一步推进深度学习和对齐方面的进展,从而实现迭代改进。根据我们的衡量,我们现在已经达到了去年秋天宣布的目标,即在今年 9 月之前拥有一个自动化研究实习生。所谓“研究实习生”,我们指的是一个能够在人类指导下执行定义明确的研究任务的系统,包括那些需要熟练研究人员花费数天才能完成的任务。我们正在朝着在 2028 年 3 月之前创建自动化 AI 研究员的目标稳步前进。
今年以来,OpenAI 研究人员的日常工作方式发生了显著变化。研究人员全天都在使用编码智能体(通常以并发会话的形式),且总使用量正快速增长,增速已超过 OpenAI 其他团队。研究人员提交代码的速度更快,运行的实验也更多。研究人员使用智能体的方式同样在改变:智能体正在处理越来越复杂的任务,并且成功率越来越高。AI 研究是一个复杂的过程,存在许多潜在瓶颈,因此整体进展速度可能不会与这些具体指标同步。但总体而言,这些发现与我们许多人在内部形成的更广泛印象一致,即智能体工具正在切实加速研究进展。人们仍然负责设定研究优先级、判断哪些想法和结果值得推进,并决定是扩展、暂停还是部署系统。
如果以负责任的方式推进,我们相信自动化 AI 研究将催生出能直接增进人类福祉并推动 OpenAI 使命实现的模型。它可以降低先进智能的成本,让全球各地的人们都能从中受益。我们开展这项工作,部分原因在于自动化研究有助于我们解决对齐问题,并为日益强大的 AI 构建防御能力。一个自动化的 AI 研究者同样可以成为自动化的安全或对齐研究者。更强大且对齐的系统有助于保护关键基础设施、防御危险的 AI 智能体,并开发新的防护措施。
这些是开发实用自动化研究能力的理由,但这并不意味着快速RSI就必然是我们应当追求的结果。是否推进以及如何推进,必须取决于我们能否保持人类控制权,以及民主社会在充分知情的前提下对收益与风险作出的选择。
我们尚不清楚如何安全地一路实现完全对齐的全面 RSI(递归自我改进)。我们正努力让对齐与安全措施同能力一起扩展。但我们不能假设对齐与安全的进展会始终同步,而且能力更强的系统可能更难监控。严谨的对齐与安全工作正是这一努力的核心,其起点是衡量并缓解我们目前在智能体编码系统中看到的安全问题。每当我们发现继续推进会带来不可接受的安全风险时,我们都会做出相应应对,包括放缓或停止开发或部署那些我们自认无法充分保障安全的系统。
在最近的 Hugging Face 事件之后,我们将这一承诺付诸行动——暂停了针对计划部署的最新模型的强化学习(RL)训练,同时进一步加固我们的研究环境、开展红队测试,并扩大监控系统的覆盖范围。这并未使所有研究停滞:部分工作负载在更强的管控下恢复运行,而另一些则继续保持暂停。我们提高了安全与对齐标准,并将安全工作进一步前移到模型生命周期的更早阶段,要求在整个训练过程中提供更强的对齐行为证据。
今天,我们提供一份详细快照,展示近几个月来智能体系统如何为我们在 RSI 方面的进展做出贡献。智能体系统是新兴且快速演变的,我们的衡量工作仍处于初步阶段。通过分享这些早期成果及其背后的方法,我们旨在让公众知情、倡导公开披露的规范,并帮助该领域迈向共同的衡量标准。
归根结底,正如我们在前沿政策蓝图中所述,我们认为我们和其他公司应当被要求公开追踪我们迈向 RSI 的进展。即使没有这样的要求,我们也计划继续在 RSI 进展方面保持透明。随着我们的测量技术和理解不断进步,我们将在保护安全和专有信息的需求之间取得平衡的同时,不断演进我们的透明度策略。
1. 编码智能体正在重塑 OpenAI 研究人员的日常工作
今年年初,OpenAI 内部按智能体使用量排名的中位研究人员,使用编码智能体的频率还相当有限。到 8 月中旬,中位研究人员已将智能体融入日常工作,按 API 价格计算,每天使用的推理量超过 600 美元。我们研究机构中排名第 90 百分位的用户,现在每天消耗超过 7,000 美元的 token。
查看方法
查看方法
在 2026 年 6 月之前,整个研究机构的智能体总运行时长仍低于人类总劳动时长。此后情况发生了变化。按标准 8 小时工作日计算,截至 8 月中旬,研究机构整体每投入一个人类工作日,就对应使用 3.1 个智能体工作日的劳动量。
查看方法
另一种理解方式是观察有多少研究人员使用高度并发的流程(例如,同时运行 4 个或更多智能体)。如下所示,这一数字正在增长。这些数据包括用户直接启动的智能体以及由用户直接启动的智能体在下游创建的子智能体的每日峰值。
查看方法
2. 研究人员正在编写更多代码并运行更多实验
AI 研究的很大一部分可以看作是一个劳动密集型过程,其目标是将对模型智能或性能的新改进整合到我们的核心模型之一中。这一过程依赖于许多步骤,只有当所有步骤都正确协同推进时,能力才能取得进步:研究人员必须设计新的改进方案,编写评估以评判模型性能,编写基础设施以大规模测试这些改进,在训练过程中捕获错误以及不安全或未对齐的行为,并将获胜的想法整合到核心训练运行中。研究过程中任何一个环节的失败都可能制约整个循环。
编写代码和运行实验是研究人员工作中两项主要活动,我们看到了这些过程正在加速的证据。
查看方法
这些数据点相对容易衡量,但可能难以解读。随着自动化程度的推进,最不易被自动化的任务将在研究人员的精力中占据更大份额,并成为未来进展的重要瓶颈。算力是进展的另一个制约因素,随着其他瓶颈的减少,算力可能随着时间的推移变得更加重要。
截至2026年,每位活跃实验者的实验数量有所增加,2026年8月创下自2025年1月开始追踪以来的历史新高。这与Codex采用率的提升相关,不过我们也注意到,自2025年以来,我们的可用算力也大幅增长。
查看方法
3. 研究人员使用智能体所从事的工作正在发生变化
定性印象和内部数据均表明,研究人员委托给编码智能体的任务构成正在发生变化,委托更高层级、更长周期任务的情况随时间推移变得越来越普遍。
为了更清晰地了解这一趋势,我们使用Epoch AI近期发布的一套分类体系,分析了研究组织内的近期使用情况。该分类体系对AI研发生命周期中涉及的各类工作进行了划分。这套分类体系借鉴了长期用于对各类工作进行分类的O*NET系统,专门针对前沿AI研发量身定制,将整个过程划分为六个主要阶段:
决策:做什么、继续什么、资源如何分配
设计:研究思路与工程规格
构建:代码与数据集
运行:训练/评估任务、硬件、服务部署
分析:实验、模型、部署、外部工作
沟通:研究结果、反馈、状态、决策
下面,我们按照这一分类体系对编程智能体的 token 进行分类。
查看方法
查看方法
我们看到,从 2026 年 1 月到 8 月,所有类别的研究活动都有所增加。1 月份,占主导地位的类别是研究与基础设施代码。这一类别仍在扩大,但我们也看到其他类别出现了显著增长,尤其是技术帮助和监控运行。高层规划在智能体输出 token 中仍然只占极小比例。
据同事们的零星反馈,编程智能体在排查内部研究基础设施问题方面表现出色,这解决了研究进展中的一个重要瓶颈。此前,多个团队曾设立答疑时间,帮助研究人员排查实验问题;而到 2026 年,这些团队的答疑参与人数明显下降,其中一个团队已完全停止举办答疑活动,转而专注于其他系统改进工作。
在这里,我们绘制了研究人员向其他团队寻求技术支持的其中一个主要内部频道每日顶级帖子的数量。据我们所知,该频道活跃度的下降并未被转移到由人工运营的其他技术支持频道所抵消。流量的下降与这一更广泛的转变相一致。
查看方法
我们还可以研究编码智能体是否成功完成了研究人员请求的任务。使用一个智能体分类器,我们发现从1月到7月,在我们能找到真实结果的任务中,几个难度档位(以人类完成该任务的预估时间作为代理指标)上的成功率普遍有所提高。然而,智能体仍然需要大量的人工引导才能成功,尤其是随着任务复杂度的提升。在过去6个月中,超过一半成功的4-8小时任务涉及1次或更多次的人工干预。
研究人员任务的成功率随时间推移有所提高。图表排除了结果不确定的分类,以及会话数<50或独立用户数<50的数据点。
查看方法
1月至7月的任务成功率与干预率,按时间跨度细分。排除了结果不确定的分类。
查看方法
4. 把控模型开发的节奏
朝着更强大、更安全且有益于人类的 AGI 系统迈进,也将取决于此类工作所需的安全保障措施。随着我们对相关风险的了解不断加深,我们对所需保障措施的评估也可能会随之调整。
正如我们之前所述, 我们近期更新了在监控、对齐和安全方面的标准。在此,我们展示近期的限制措施如何影响了研究活动的其中一个方面。
*此处展示的 7 月 20 日至 8 月 6 日期间 Astra 的大部分算力,旨在测试安全与安保改进措施的实施情况。
查看方法
7月20日,在发现智能体入侵了我们的研究基础设施后,我们暂时关闭了用于训练的计算容器服务,随后在增加大量额外限制的基础上恢复了该服务。
这导致强化学习训练算力急剧下降,因为各团队需要重新配置工作流程,以适应经过加固的研究环境。上图包含了我们为部署而准备的最新模型在强化学习上的两周暂停期。7月20日至8月6日期间的Astra级强化学习实验中,大多数运行(按GPU分配计算)旨在测试安全与安保改进措施的实施情况。
8月7日,初步证据表明,根据我们的《预备框架》,Astra 可能具备关键的网络能力,这促使我们实施了额外的、针对该模型的特定安全限制,要求 Astra 模型必须在更高级别的安全研究环境中运行。在接下来的一周里,Astra 类别的 GPU 分配量进一步下降了 59.2%,但其他模型类别的分配量上升了 17.2%。这一增长抵消了 Astra 类别约 85% 的降幅,使得所分析的 RL 工作负载中的总分配量基本保持不变。这种模式与以下情况相符:在涉及 Astra 的工作受到限制的同时,部分训练和实验被转移到非 Astra 模型上;这也与研究人员将算力用于其他用途的传闻报告一致——这些算力已无法再用于受新约束条件覆盖的工作负载。
这些数据为当前关于训练与安全的讨论提供了有用的信号:当引入新的管控措施时,算力仍然具有价值且用途灵活,并会自然而然地被引导到研究体系内的其他用途上。从长远来看,关于 AI 进展速度的讨论,也应延伸到这样一个问题:受新的或拟议管控措施约束的算力,如何才能得到最佳利用。
5. 未来之路
取得并理解迈向对齐的 RSI(递归自我改进)的进展,对我们的使命至关重要。我们将继续完善我们的方法,报告我们不断演进的理解,并努力推动知情的公众辩论以及对前沿系统的有意义的民主治理。
附录:本文所采用的方法
智能体驱动的 AI 研究仍处于早期阶段,我们也在不断学习如何衡量它。有些指标,比如我们研究团队生成的代码量,相对容易收集,但难以解读,因为其与研究进展之间的关系并不确定。更直接聚焦研究进展的指标——例如智能体在研究人员交给它们的任务上取得成功的频率——可能更有用,但开发和验证起来也更为复杂。更添难度的是,研究人员所依赖的工具和系统正在快速演进。加深对研究加速的理解,是 OpenAI 上下重点关注的一个领域。
在上述各项分析中,除非另有说明:
“研究人员”是一个宽泛的说法,指我们研究组织中的任何成员,包括那些构建研究基础设施、管理研究项目或以其他方式支持研究事业的人。
鉴于研究人员所依赖的工具和系统快速演进,编码智能体使用情况的指标覆盖了大部分(但并非全部)使用场景。
2026
经济研究
原文
Original Title
Research acceleration: The view inside OpenAI
Source
OpenAI:官网动态(RSS · 排除企业/客户案例)
Site
openai.com
Published
2026-09-06 16:00