面向Google编程CHARLES ZHANG

AI DAILY / 2026-09-09

GPT-6 Astra:OpenAI新一代旗舰模型发布

GPT-6 Astra: A new generation of intelligence

上下文与记忆OpenAI · 2026-09-03

全文中文翻译 · AI 生成,仅供学习交流

GPT-6 Astra:新一代智能

GPT‑6 Astra(以下简称 Astra)汇聚了多年来在预训练(pre-training)、强化学习(reinforcement learning)和对齐(alignment)方向的研究积累与重金投入。Astra 在计算机使用(computer use)、浏览器操作、软件开发、网络安全、科学研究以及专业工作等领域都做到了业内顶尖。Astra 在 FrontierMath Tier 4 上拿下 98% 的成绩,把这一基准刷到接近天花板,并已助力解决若干长期悬而未决的数学开放问题。Astra 也以 99.9% 的分数把 ARC-AGI-3 刷到几乎封顶,ExploitBench 更是拿下 100% 的满分。它还在计算机与浏览器使用上立起了新标杆,能以前所未有的速度、准确度与判断力应对最苛刻的专业任务。

GPT‑6 Astra 今天起向部分机构开放,未来几天内陆续开放给所有 ChatGPT Plus、Pro、Business 与 Enterprise 用户,同时也通过 OpenAI API、Microsoft Azure 和 AWS Bedrock 提供。

> 「在 ARC-AGI-3 上,Astra 在 96% 的关卡中超过我们的人工操作效率基线,事实上在这项基准上达到了人类水平。它不仅是我们测试过的最强模型,也代表着前沿模型性能一次有意义的跃升,无论是其在陌生环境中导航求解的能力,还是学习的效率。」
>
> Greg Kamradt,ARC Prize Foundation Astra 是我们对齐程度最高的模型,在理解用户意图和把握自身行为方面取得了实质进步,你可以更放心地把任务交给它去判断。为了验证这一点,我们构建了一项受 Hugging Face 事件启发的新评估,专门测试模型在面对困难或不可能完成的任务时会不会越权行事。GPT‑5.6 Sol 在没有生产安全防护的情况下,48% 的情况会越出授权范围。GPT‑6 Astra 这个数字是 0%。

全球最强的计算机使用模型

GPT‑6 Astra 在计算机使用的速度、准确度和安全性上都立起了新标杆。它能帮你处理那些琐碎的事,比如填在线表单、在 CRM 里更新客户记录、收拾你的日历。它能在线搜资料,然后在邮件或文档编辑器里帮你起草摘要。它能分析科学数据、画图表、做网站,还能给网站跑一遍前端 QA,确保各个功能都正常。它能自主安装和测试软件,帮你排查屏幕上看到的问题。这些改进也体现在我们业内顶尖的评测成绩里。

这些改进同样在实际知识工作里带来了显著的效率提升。在 OSWorld 2.0 的时延模拟中,Astra 用比 GPT‑5.6 Sol 少约 47% 的单任务时间,做到了更高的计算机使用表现。每个任务约 40 分钟,得分 72.6%;GPT‑5.6 Sol 每个任务约 75 分钟,得分 65.7%。

GPT‑6 Astra 的计算机使用能力,在不同领域的输出里都能看到,比如游戏开发、电气工程,以及日常知识工作。配合 Astra,我们也在更新 Codex 的运行环境(harness),让计算机使用的速度明显加快。再叠加上 Astra 本身的效率,在 Mind2Web 基准上,任务完成速度比当前的 GPT‑5.6 Sol 快了 1.9 倍。速度上来之后,它就能替你扛下很多原本很花时间的日常事,比你自己动手还快。

> 「我们将在发布当天就把 GPT‑6 Astra 集成到 Devin 的运行环境中,它在我们的内部测试基准上达到了业内顶尖。它出色的计算机使用、写作与代码库理解能力,开箱即用就改善了测试体验,视频讲解更易跟随,报告更清晰、更精炼。」
>
> Silas Alberti,Cognition SVP Research

专业工作的大步跃升

GPT‑6 Astra 把计算机使用的进步与针对专业环境的定向训练结合起来,专门应对复杂的工作任务。它既具备解决复杂问题所需的智能,也能跑多步工作流,产出精致的文档、电子表格和幻灯片。

GPT‑6 Astra 是我们在遵循既有模板、产出排版精美且能用结构化叙事简洁传达要点的幻灯片方面表现最好的模型。它能产出清晰、结构严谨的文档、演示文稿、电子表格与分析,严格遵循你的模板,匹配你的写作与视觉风格。Astra 还经过专门训练,只挑出真正相关的上下文,不会塞一堆当前任务用不上的信息。这一切都让它能直接交付更贴合你业务背景与标准的成品。

GPT‑6 Astra 还为它构建的网站、游戏、应用和渲染效果带来了更强的视觉判断力。借助 ChatGPT 的 Sites 功能,Astra 可以直接根据一段提示词(prompt)创建、托管并分享网站、Web 应用和游戏。

> 「Astra 在能力与效率两方面都给我们带来了显著优势。它能成功执行我们最复杂的创意工作流,同时比我们测过的其他模型少用多达 20% 的 token(译注:模型的最小处理单元,可粗略理解为「字词片段」)。更重要的是,对客户来说,输出质量也因此上了一个台阶。」
>
> Alex Mashrabov,Higgsfield AI CEO 兼联合创始人当指令留有解释空间时,GPT‑6 Astra 比以前的模型更擅长作出正确判断。它会利用上下文填上常规的缺口,在答案可能影响结果时提出精准的问题。在 Codex 中,它能异步提问,同时继续推进不依赖你回复的工作。如果你没回复,它会在合适的地方按合理假设继续推进,但对重大决策会等你拍板。

下面的例子展示了 Astra 在日常任务里如何与你协作,这些任务一旦缺了关键信息,答案就会大变样。

Astra 还更擅长在任务演进中保持方向感。早期的模型有时会把用户的引导消息当成新目标,从而丢失对原始请求或先前约束的追踪。Astra 会吸收新的需求、按要求调整方向,回答支线问题时也不丢掉更宏观的任务目标。

> 「在复杂的法律任务上,Astra 是相对 GPT‑5.6 Sol 的一次显著质量提升。在早期测试中,Astra 以一种有辨识力的律师方式处理法律工作脱颖而出,它能区分一般文档与既定记录,揭示缺乏依据的假设,并把证据缺口转化为具体的起草立场。」
>
> Niko Grupen,Harvey Head of Applied Research

编程

GPT‑6 Astra 是迄今为止最强的软件开发模型。

> 「GPT‑6 Astra 在我们的内部编程基准上做到了业内顶尖,在交易直觉评估(trading intuition evaluations)上也明显领先 GPT‑5.6 Sol。用在智能体式编程(agentic coding)上时,GPT‑6 Astra 跟开发者的沟通更易跟随,产出的代码也能以更少的迭代达到生产级质量。」
>
> John Crepezzi,Jane Street AI Assistants> 「我们在第一代评估之一上对 Astra 进行了低、中、高三档投入水平的测试,结果都明显领先 GPT 5.6 Sol。更高的投入带来的是,在全新构建里更多的迭代、通过浏览器测试更扎实的验证,以及倾向于以代码执行而非 apply-patch(译注:一种以打补丁方式修改文件而非运行脚本的工具调用方式)来完成任务。理解模型如何分配投入,是我们给上百万构建者提供从想法到可用应用更快、更可靠路径的关键。」
>
> Fabian Hedin,Lovable CTO 兼联合创始人 1 of 2> 「GPT‑6 Astra 在我们的内部编程基准上做到了业内顶尖,在交易直觉评估上也明显领先 GPT‑5.6 Sol。用在智能体式编程上时,GPT‑6 Astra 跟开发者的沟通更易跟随,产出的代码也能以更少的迭代达到生产级质量。」
>
> John Crepezzi,Jane Street AI Assistants> 「我们在第一代评估之一上对 Astra 进行了低、中、高三档投入水平的测试,结果都明显领先 GPT 5.6 Sol。更高的投入带来的是,在全新构建里更多的迭代、通过浏览器测试更扎实的验证,以及倾向于以代码执行而非 apply-patch 来完成任务。理解模型如何分配投入,是我们给上百万构建者提供从想法到可用应用更快、更可靠路径的关键。」
>
> Fabian Hedin,Lovable CTO 兼联合创始人Jane Street  Lovable借助 Astra,我们为 Codex 引入了一种新方式,能在上下文窗口(context window)填满时保存并检索上下文。以前,模型在长会话中会用压缩(compaction)来总结工作,比如调试复杂问题或处理大型重构时。每一次压缩都可能漏掉一些关键信息,比如修复为什么失败,或者某个组件实际是怎么运作的。在 Codex 里,Astra 能在多个上下文窗口之间保留笔记(notes),把累积的细节存下来,不用反复压缩成单一摘要。早一点的上下文窗口依然可以检索,所以 Astra 能从之前的消息和工具输出里翻出需求或测试结果,哪怕这些信息没被写进笔记。你可以在 Codex 的 config.toml 中启用这个实验性功能,它会在未来几周成为 Astra 的默认行为。

推进科学发现

> 「故事是这样的,一个时代落幕,另一个时代开启。」
>
> Greg Burnham,EpochAI GPT‑6 Astra 是面向科学发现、数学与健康的一次重大进展。今天,我们会再分享两项关于素数间隔(gaps between prime numbers)的成果。

,Astra 在一系列数学与科学评测中也创下了新纪录。

Astra 能帮上科学发现背后的实际工作。把科学推理和计算机使用结合起来,它能直接钻进专业软件里检查数据、探索结果,帮研究者评估证据,决定下一步该研究什么。

网络安全

正如我们在安全更新中讨论的,Astra 在网络安全能力上是一次重大跃升,依据我们的 Preparedness Framework 达到了网络安全领域的「关键(Critical)」阈值。它发现并开发零日漏洞(zero-day exploit)的能力能帮防御者发现并修补弱点,但也因此更需要更强的防护措施。为了摸清这些能力到底延伸到了哪里,我们在内部和第三方专家评估上对 Astra 进行了测试。

我们先在不开启生产安全防护的情况下,在 ExploitBench 和 ExploitGym 上对模型进行了测试,二者评估模型能否把已知软件漏洞转化为可工作的漏洞利用程序(exploit)。在 ExploitBench 上,Astra 拿到了 100% 的满分,而我们上一代的前沿网络模型 GPT‑5.6 Sol 是 78.5%。在 ExploitGym 上,Astra 的成功率为 42.4%,GPT‑5.6 Sol 是 30.3%,而且 Astra 用的输出 token 数也大幅减少。

考虑到接触过历史软件漏洞可能影响基准成绩的担忧,我们还在两个全新基准上对 Astra 做了评估。其中之一是我们自建的内部「ExploitBench(2026 年 6 月–8 月)」评估,用过去三个月的漏洞来测试漏洞利用程序的开发能力。

在这份数据集上,Astra 的任意代码执行成功率大幅高于 GPT‑5.6 Sol,同时用的输出 token 数也远少于后者。评估过程中,Astra 甚至发现并利用了两个此前未知的零日漏洞。我们正在把这两个漏洞披露给它们的维护者。

我们还在 SRE-Bench 上对 Astra 进行了测试,这个基准衡量模型能不能在拿不到原始源代码的情况下对软件二进制做逆向工程,理解其核心逻辑。Astra 单次尝试就解决了 88.0% 的任务,四次尝试内解决了 99.2%;GPT‑5.6 Sol 分别为 55.9% 和 68.7%。

除基准外,专家主导的评估也发现,在不开启生产安全防护的情况下,Astra 能利用此前未知的漏洞在加固过的浏览器里实现任意代码执行,并针对加固过的操作系统创建权限提升漏洞利用程序。

正如我们在 The Defender's Window 中讨论的,前沿网络能力能帮防御者更快发现弱点,但同样也让这些弱点更容易被利用,提升了防御者加快适应的紧迫性。今天随 Astra 一起发布的版本,防御者可以用它来做安全代码审查、打补丁等任务。

不过,Astra 会拒绝执行更高级的网络安全任务,比如为漏洞创建概念验证(proof-of-concept)漏洞利用程序。通过 OpenAI Daybreak,我们计划在未来几周扩大访问范围,并推出限制更少的安全防护。这将支持更多防御性工作流,包括漏洞与概念验证验证、恶意软件分析以及检测工程。

我们还加强了对潜在网络滥用的防护,构建在 GPT‑5.6 Sol 安全防护栈的基础上。这些改进包括更强的模型鲁棒性,能更好地抵御潜在的越狱(jailbreak)攻击,以及给我们监控系统提供更丰富的上下文。我们持续进行严格的内部和外部测试,包括用我们的内部红队(red-teaming)攻击者进行自动化评估。关于我们网络安全防护与测试的更多细节,可参见 Astra 安全概览和系统卡(system card)。

负责任地对齐与部署 GPT‑6 Astra

Astra 是我们对齐程度最高的模型。它擅长审慎行事、尊重任务边界,沟通上也更透明。这份成果是我们长期研究项目的最新产出,这个项目专注于从头到尾训练与人意图保持对齐的模型。

在敏感场景里,Astra 的谨慎程度会跟风险等级匹配。在一项专门挑出来诱发不良行为的计算机使用任务评估中,Astra 更善于避免意外后果。配合默认提供的额外安全措施运行时,表现还会更强。

相比任何其他测试过的前沿模型,Astra 引发的对齐失误更少。为了公平比较,我们使用了通用的计算机使用智能体运行环境(基于 OpenAI Responses API 和 Anthropic Messages API 中都可用的原生 computer use 工具),且未启用通常部署给 Codex 和 ChatGPT Work 用户的额外保护(自动审查、确认策略)。

Astra 也更倾向于在用户设定的、以及环境暗示的边界之内运作。在一项内部评估中,Astra 从未尝试绕过 Codex Auto-Review 的拒绝。即便 Auto-Review 被刻意配置成可被绕过、且任务不绕过它就完不成的情况下,这一结论依然成立。这种对环境约束的尊重,与我们在本文开头分享的「不可能完成的网络任务」评估结果,以及系统卡中记录的其他发现,保持一致。

Astra 还在透明的用户沟通方面树立了新标杆。在一项评估中,Astra 作出关于自身能力与可用性的不准确陈述的可能性,只有 GPT‑5.6 Sol 的三分之一。

在我们的能力幻觉(capability-hallucination)评估中,Astra 相比 GPT‑5.6 Sol 有了显著改善,关于自身能力作出误导性陈述的情形更少。

我们的评估发现,在明确要求规避监控的测试中,Astra 的书面推理比 GPT‑5.6 Sol 更难被监控。我们把这一点归因于 Astra 在较简单任务上对书面推理有更强的掌控力,并且能用更少的书面步骤解决问题。Astra 在隐匿复杂任务所需推理上似乎仍然吃力,不过我们对监控难度上升这件事是认真对待的。提升可监控性仍是研究重点,随附的系统卡详细介绍了我们的发现与正在进行的工作。

对齐训练是我们部署方法的核心。作为额外一层防御,我们也构建了系统级防护,比如 Codex Auto-Review,以及监控智能体的推理与行为,以便检测并遏制不安全行为。正如我们在安全更新中所描述的,我们还在生产环境中为 Astra 级模型部署对齐监控,让对齐问题具备可见性,并遏制最严重的实例。这些防护与我们对内部部署的监控类似,依靠一套分类器系统检查模型推理与行为中的未授权行为,并自动中止潜在的未授权活动。

鉴于 Astra 网络安全能力的大幅提升,我们对这次部署的安全性与稳妥性格外审慎。额外的安全检查有时会拖慢、暂停甚至停止合法工作,包括防御性网络安全。如果任务在 ChatGPT 或 Codex 中被暂停,你可能需要先复核这一操作才能继续。在 API 中,任务会直接停止。这些检查有时会打断合法工作,我们也在持续迭代这套系统,以减少不必要的打扰。对齐监控不能替代对齐本身,我们的目标是构建能可靠地停留在授权范围内的模型,让这些保护根本不需要介入。

可用性

GPT‑6 Astra 今天起向部分机构开放,未来几天内陆续开放给所有 ChatGPT Plus、Pro、Business 与 Enterprise 用户,同时也通过 OpenAI API、Microsoft Azure 和 AWS Bedrock 提供。Astra 的使用量包含在现有订阅额度内,用户和企业也可以购买额度以获得更多用量。Pro、Business 与 Enterprise 计划的用户还将获得 GPT‑6 Astra Pro 的访问权限。企业管理员可为其工作区启用 Astra,发布时默认关闭。

Astra 为符合条件的 API 客户提供零数据保留(Zero Data Retention)支持。正如我们上个月分享的,我们正在测试 Private Safety Processing,在保护客户隐私的同时加强安全监控。

对开发者而言,GPT‑6 Astra 将以 gpt-6-astra 的形式在 OpenAI API 上提供,也通过 Microsoft Azure 和 Amazon Bedrock 提供。

OpenAI API 标准定价为每百万输入 token 10 美元、每百万输出 token 50 美元。缓存读取与写入分别适用不同费率。Fast 模式可在 API 中用于 GPT‑6 Astra,速度最高可达 Standard 的 2 倍,价格也是 Standard 的 2 倍。

Computer Use
Computer Use                              GPT‑6 Astra    GPT‑5.6 Sol    Claude Fable 5.1    Claude Fable 5    Claude Opus 5    Gemini 3.8 Flash
Agents' Last Exam                         59.3%          53.6%          48.7%               55.5%
OSWorld 2.0 (v2026.08.08, offline set,
partial score)                            72.6%          65.7%          70.2%
ScreenSpot-Pro (no tools)                 92.7%          76.9%          87.3%

Professional
Professional                              GPT‑6 Astra    GPT‑5.6 Sol    Claude Fable 5.1    Claude Fable 5    Claude Opus 5    Gemini 3.8 Flash
AutomationBench                           41.4%          18.1%          31.4%               17.4%             26.9%
BenchCAD                                  95.9%          83.3%          84.3%               67.5%             82.1%
BrowseComp                                91.5%          90.4%          87.4%               90.8%
OpenScore String Quartets (1 - OMR-NED)   0.84           0.19
Internal Design Tasks                     50.0%          47.4%          35.8%
Internal Data Science Tasks               40.9%          30.5%          34.7%
Artificial Analysis Intelligence Index
v4.1.1                                    61.2           60.9           65.7                62.1              63.1             58.7

Coding
Coding                                    GPT‑6 Astra    GPT‑5.6 Sol    Claude Fable 5.1    Claude Fable 5    Claude Opus 5    Gemini 3.8 Flash
Terminal-Bench 4.0                        57.9%          37.3%          55.8%               44.5%             52.6%            19.1%
DeepSWE v1.1                              74.1%          72.7%          67.4%               69.9%             73.7%            73.8%
FrontierCode 1.1 Extended (score)         64.5%          60.6%          63.6%               64.9%             63.6%            56.3%
FrontierCode 1.1 Main (score)             53.3%          47.5%
原文配图