AI DAILY / 2026-09-10
研究加速:OpenAI内部如何看待自动化AI研究员进展
Research acceleration: The view inside OpenAI
全文中文翻译 · AI 生成,仅供学习交流
研究加速:OpenAI 内部视角
要让 AGI 惠及全人类,我们认为它必须由民主方式治理。这只能通过一场知情且公开的辩论来实现,辩论的对象是高度 capable AI 系统的能力、风险与安全措施。世界各地的人们需要理解前沿 AI 大概率的未来轨迹,这样他们才能在它如何发展这件事上发出有意义的声音。
关于具体风险、事件和安全措施的透明度是必要的,但不充分。我们认为,公众还需要了解最有能力的系统是如何发展的,以及它们在 frontier labs 内部是如何推动研究进步的。
我们的目标是安全地构建一个能在人类监督下工作的自动化 AI 研究员,从而推动深度学习与 alignment(对齐)领域的进步,并实现迭代式改进。根据我们的测量,我们已经达成了去年秋天宣布(opens in a new window)的目标:即在今年 9 月之前拥有一名自动化研究实习生。所谓"研究实习生",我们指的是一个能在人类指导下执行明确定义的研究任务的系统,包括那些需要一位熟练研究员花费数天才能完成的任务。我们正在朝着 2028 年 3 月前打造一名自动化 AI 研究员这一目标稳步前进。
今年这一年间,OpenAI 研究员的日常工作发生了实质性变化。研究员们全天都在使用 coding agents(通常是在并发的会话中),总体使用量在迅速增加,增速超过了 OpenAI 其他团队。研究员们提交代码更快、运行的实验更多。研究员们使用 agent 的方式也在改变:agent 正在处理越来越复杂的任务,并且越来越频繁地完成它们。AI 研究是一个复杂的过程,存在许多潜在的瓶颈,因此整体进步速度可能跟不上这些具体指标。但总体而言,这些发现与我们许多人在内部的更广泛印象一致,即 agentic 工具正在显著地加速研究进步。研究的优先级仍然由人设定,哪些想法和结果值得追求、是否要扩大规模、暂停或部署系统,仍然由人来决定。
如果负责任地完成,我们认为自动化的 AI 研究将产生能直接增进人类福祉、并推动 OpenAI 使命的模型。它可以降低先进智能的成本,让全世界人民都能从中受益。我们推进这项工作,部分原因是自动化研究可以帮助我们解决对齐问题,并为越来越 capable 的 AI 构建防御。自动化的 AI 研究员也可以是一名自动化的安全或对齐研究员。更 capable 且对齐的系统有助于保护关键基础设施、防御危险的 AI agent,并开发新的保护措施。
这些都是发展有用的自动化研究能力的理由,但它们并不意味着快速的 RSI 必然是一个我们应该追求的结果。是否推进以及如何推进,必须取决于我们维持人类控制的能力,并取决于关于其收益与风险的知情民主选择。
我们还不知道如何安全地一路走到对齐的、完全的 RSI。我们正在努力使对齐与安全措施与能力同步扩展。但我们不能假设对齐与安全的进步能跟上节奏,更 capable 的系统也可能变得更难被监控。细致的对齐与安全工作处于这一努力的核心,它从测量并缓解我们在 agentic 编码系统中今天看到的安全问题开始。每当我们发现继续推进会带来不可接受的安全风险时,我们会采取适当的行动,包括放缓或停止我们发现自己无法充分保障的系统的开发或部署。
在最近的 Hugging Face 事件之后,我们落实了这一承诺,暂停了对我们最新一代、用于部署的模型的强化学习(RL)训练,同时进一步加固并红队测试了我们的研究环境,并扩大了监控系统的覆盖范围。这并没有让所有研究停摆:部分负载在更严格的管控下恢复运行,另一些则继续保持暂停。我们提高了安全与对齐标准,并将安全工作更深入地嵌入到模型生命周期中,要求在整个训练过程中提供更强的对齐行为证据。

今天我们正在提供一份详细的快照,展示 agentic 系统如何在过去几个月中为我们的 RSI 进展做出了贡献。Agentic 系统是新兴的、并且在快速变化,我们的测量工作仍处于初步阶段。通过分享这些早期结果及其背后的方法,我们的目标是告知公众、鼓励公开披露的规范,并帮助整个领域走向共享的测量标准。
最终,正如我们在 frontier 政策蓝皮书中所写,我们认为我们以及其他公司应当被要求公开跟踪我们在 RSI 上的进展。即使没有这样的要求,我们也计划继续透明地披露我们的 RSI 进展。我们将随着测量技术和理解的改进而不断演进我们的透明度方式,并在其中平衡保护安全和专有信息的需要。
1. Coding agents 正在重塑 OpenAI 研究员的日常工作
今年年初,OpenAI 按 agent 使用量排序的中位数研究员,仅仅在以较少的量使用 coding agents。到了 8 月中旬,中位数研究员已经将 agent 集成到日常工作中,每天使用超过 600 美元的推理 API 价格。我们研究组织中第 90 百分位的用户现在每天使用超过 7000 美元的 tokens。

View methods View methods 在 2026 年 6 月之前,整个研究组织的 agent 总运行时间仍低于人类劳动的总运行时间。此后情况发生了变化。以标准的 8 小时工作日衡量,截至 8 月中旬,研究组织总计每投入一个工作日的人工,就使用 3.1 个 agent 工作日的算力。

View methods 另一种观察方式是了解有多少研究员采用了高并发工作流(例如,同时运行 4 个或更多 agent)。如下图所示,这个数字正在增加。这些数据既包括用户直接启动的 agent 的每日峰值,也包括从这些 agent 下游派生的 subagents。

View methods
2. 研究员正在写更多代码、运行更多实验
许多 AI 研究可以被视为一个劳动密集型的过程,其目标是将模型智能或性能的一个新改进整合进我们的核心模型之一。该过程依赖许多步骤,而当所有步骤一起顺利推进时,能力才会进步:研究员必须设计新的改进、编写用于评判模型性能的 evaluations、编写用于大规模测试这些改进的基础设施、在训练过程中捕捉 bug 以及不安全或不对齐的行为,并将获胜的想法整合进一次核心训练运行。研究过程中的任何一环失败都可能限制整个循环。
写代码与运行实验是研究员工作中两项主要活动,我们看到这些过程正在加速的证据。

View methods 这些数据点相对容易测量,但可能难以解释。随着自动化不断推进,最不易自动化的任务将在研究员精力中占据更大份额,并将成为未来进步的重要瓶颈。算力是另一个限制进步的因素,随着其他瓶颈的减弱,它可能会随着时间推移变得更加重要。
贯穿 2026 年,每个活跃实验者的实验数量在增加,2026 年 8 月是自 2025 年 1 月开始追踪以来的历史最高水平。这与 Codex 的采用率增加相关,不过我们也注意到,自 2025 年以来我们可用的算力也显著增长了。

View methods
3. 研究员使用 agent 所做的任务正在发生变化
定性印象和内部数据都表明,研究员委派给 coding agents 的任务组合正在变化,对高层级、长周期任务的委派随时间推移变得越来越普遍。
为了更清楚地把握这一趋势,我们使用最近发表的一篇(opens in a new window)、由 Epoch AI 制定的 AI R&D 生命周期中各类工作分类法,分析了研究组织最近的使用情况。这一分类法受到用于分类所有类型工作的长期使用的 O*NET 系统的启发,专门为前沿 AI R&D 量身定制,将过程分为六个主要阶段:Decide(决定):做什么、继续做什么、将资源分配到哪里 Design(设计):研究想法与工程规格 Build(构建):代码与数据集 Run(运行):训练/评估运行、硬件、服务 Analyze(分析):实验、模型、部署、外部工作 Communicate(沟通):发现、反馈、状态、决策 下面,我们按此分类法对 coding agent 的 tokens 进行分类。
View methods View methods 我们看到,2026 年 1 月到 8 月之间,所有类别的研究活动都有所增加。在 1 月,占主导地位的类别是研究与基础设施代码。该类别已经扩展,但我们也看到其他类别有显著增长,特别是技术帮助与监控运行。高层规划仍然只占 agent 输出 tokens 的一小部分。
据同事们口述,coding agents 在排查内部研究基础设施故障方面表现出色,这解决了研究进展中的一个重要瓶颈。多个先前为帮助研究员排查实验问题而设立 office hours 的团队注意到,2026 年内出席率持续下滑,其中一个团队已经完全停办相关时段,转而集中精力改进其他系统。

在这里,我们绘制了某主要内部频道(研究员在该频道向其他团队寻求技术支持)的每日顶级帖子数量。据我们所知,该频道活跃度的下降并未被转向其他由人运营的技术支持频道的查询所抵消。流量的下降与这一更广泛的转变一致。
View methods 我们还可以研究 coding agents 在研究员请求的任务上是否成功。使用一个 agentic 分类器,我们发现从 1 月到 7 月,在我们能找到 ground truth 结果的任务上,按若干难度档位(以人类估计完成该任务所需的时间为代理)来看,成功率总体上有所提高。然而,agent 仍然需要显著的人类引导才能成功,特别是在任务复杂度上升时。在过去的 6 个月中,超过一半成功的 4-8 小时任务涉及至少一次人工干预。
研究员任务的成功率随时间推移而提高。图表排除了结果不确定的分类,以及样本数少于 50 次会话或少于 50 名独立用户的数据点。

View methods 从 1 月到 7 月,按时间跨度划分的任务成功率和干预率。排除了结果不确定的分类。
View methods
4. 调节模型开发的节奏
朝向我们使命的、更 capable 的、安全且有益的 AGI 系统的进步,也将取决于该工作所需的安全措施。随着我们对风险了解的深入,我们对所需安全措施的评价也可能改变。
正如我们已描述的,我们最近更新了我们的监控、对齐与安全标准。这里,我们展示近期限制如何影响了研究活动的某个方面。
*7 月 20 日至 8 月 6 日之间,此处显示的大部分 Astra 算力本意是用于测试安全与安全改进的实现。
View methods 7 月 20 日,在发现 agent 破坏了我们的研究基础设施之后,我们暂时关闭了用于训练的容器服务,然后以大量新增的限制恢复了它。
这导致了 RL 训练算力的急剧下降,因为各团队重新配置他们的工作流,以便在加固后的研究环境中运行。上图包括我们最新一代、用于部署模型的为期两周的强化学习暂停。7 月 20 日至 8 月 6 日之间的 Astra 级 RL 实验包括多数(按 GPU 分配计)的运行,其目的是测试安全与安全改进的实现。
8 月 7 日,Astra 可能具备我们 Preparedness Framework(opens in a new window)下的关键网络能力的初步证据,触发了额外的、模型层面的安全限制,要求 Astra 模型在安全级别更高的研究环境中运行。接下来的一个星期内,Astra 类的 GPU 分配进一步下降了 59.2%,但其他模型类别的分配上升了 17.2%。该增长抵消了约 85% 的 Astra 类下降,使所分析的 RL 负载中的总分配大体保持不变。这一模式与下述情况一致:一些训练与实验被替换到非 Astra 模型上,同时涉及 Astra 的工作受到限制;这也与研究员的轶事性报告一致,他们为那些无法再用于受新约束覆盖的负载的算力找到了别的用途。
这些数据为正在进行的、关于训练与安全的讨论提供了有用的信号:当引入新的控制时,算力仍然是有价值且灵活的,并会被自然地引导到研究企业内部的其他用途。长期来看,关于 AI 进步节奏的讨论也应延伸到关于受新的或拟议的控制约束的算力如何被最佳使用的问题。
5. 前方的路
在迈向对齐的 RSI 的道路上取得进步并理解这些进步,对于我们的使命而言十分重要。我们将继续完善我们的方法、报告我们不断演进的理解,并致力于促成一场知情的公开辩论,以及对前沿系统有意义且民主的治理。
附录:本文的方法 由 agent 驱动的 AI 研究仍是新生事物,我们仍在学习如何衡量它。一些指标,例如研究团队生成的代码量,相对容易收集,但难以解释,因为它们与研究进展的关系不确定。更直接聚焦于研究进展的指标,例如 agent 在研究员交给它们的任务上成功的频率,可能更有用,但开发和验证也更复杂。更加困难的是,研究员所依赖的工具和系统正在快速演进。深化我们对研究加速的理解是 OpenAI 内部的一个重要工作重心。
在以上所有分析中,除非另有说明:"Researcher"是一个宽泛的术语,指研究组织中的任何成员,包括一些构建研究基础设施、管理研究项目或以其他方式支持整个研究工作的成员。

