面向Google编程CHARLES ZHANG

AI DAILY / 2026-09-10

GPT-6 Astra:面向工作的下一代智能模型

GPT-6 Astra: The next generation in intelligence for work

上下文与记忆OpenAI · 2026-09-09

全文中文翻译 · AI 生成,仅供学习交流

GPT-6 Astra:工作智能的下一代

上周我们发布了 GPT‑6 Astra,全球最智能、也是迄今为止对齐程度最高的模型,现已在 ChatGPT Work、Codex 以及 API 中可用。Astra 在计算机使用(computer use)、浏览、专业工作、软件工程、网络安全和科学上都达到了当前最优(state-of-the-art),团队因此能以前所未有的速度、准确度和判断力去承担最苛刻的专业工作。

复杂工作的最佳模型

大多数 AI 系统都要求企业先准备数据、重新设计工作流,再做定制化集成,才能真正产生价值。Astra 改变了这一点。在 ChatGPT Work 和 Codex 中,它能写代码,还能在人们日常使用的应用程序里执行任务,就算这些应用没有 API(应用程序编程接口),也不影响。企业从第一天起就能把 AI 嵌进既有工作流,前期准备和工程量都不用堆太多。

上线后的头几天,我们已经看到客户把 Astra 投入实际使用了。从优化 GPU,到在财务报表里挑出差异,再到产出更契合品牌的演示文稿,场景不少。

1 of 6> 「我们正在 Astra 发布当天就把它接入 Devin 的执行框架(harness),在我们的内部测试基准上拿到了当前最优(state-of-the-art)的成绩。它在计算机使用、写作和代码库理解上的出色能力一开箱就让测试环节有了提升,测试视频明显更容易跟上,报告也更清晰、更简洁。」
> , Silas Alberti,Cognition 高级副总裁(研究)
>
> 「GPT‑6 Astra 在我们的 OfficeQA Pro & Pro V2 基准上刷新了当前最优(state-of-the-art)成绩,用的是我们的 Genie 框架。它的单任务成本也明显低于 GPT‑5.6 Sol。整个基准测下来,它在企业级数据推理和文档理解上都明显高出一截。」
> , Ivan Zhou,Databricks 主任研究工程师与技术负责人
>
> 「Astra 在我们的评测里创下了新高,它产出了我们测试过的最佳演示文稿,比次优模型对任务要求的遵循度高 17%,把论点出处对应到正确文档的频率也高出 19%。对那些要在密密麻麻的财务材料里梳理信息的分析师来说,产出的演示文稿和答案是能直接交给客户、逐句追问的。」
> , George Sivulka,Hebbia 创始人兼 CEO
>
> 「Astra 是我们测试过的最强模型之一,在复杂的企业工作流里表现领先。最让我们印象深刻的是它的判断力,面对文档并不支持的结论,它更懂得拒绝贸然下结论。整个评测下来,它做出过度自信错误断言的概率低了 10% 以上。」
> , Yashodha Bhavnani,Box 副总裁(AI 产品)
>
> 「Astra 能读懂你的视觉构想,还知道怎么用 Figma 把它实现出来,一边处理复杂设计,一边让你牢牢把住创意方向。」
> , Loredana Crisan,Figma 首席设计官
>
> 「Astra 在智能和写作质量上都跨出了一大步,多智能体(multi-agent)协调能力更强,对请求里那些心照不宣的意图也把握得更准(译注:quiet intent 指用户没有明说但期望 AI 自己领会的那层小心思)。这种组合在法律行业尤其重要,理解用户真正想达成什么,再用精准而有分寸的方式表达出来,是不可或缺的能力。」
> , Omar Bari,汤森路透实验室(Thomson Reuters Labs)应用研究副总裁Cognition、Databricks、Hebbia、Box、Figma、汤森路透实验室

OpenAI 内部也在用

在 OpenAI,Astra 在发布前几周就先在内部铺开了,所以我们亲眼看见了计算机使用等前沿能力是怎么改变工作方式的。我们的开发者和市场团队用 Astra 和 Codex 把三小时的多机位素材剪成了 GPT‑6 Astra Developer First Impressions 这支视频,4 天内播放量就突破了 55 万次。工程团队则用 Astra 排查并解决了一个导致 Codex 会话变慢的内存分配瓶颈,换用不同的分配器之后,轮次延迟降到了原来的 1/25,峰值内存占用则高了大约 30%。

Astra 也更擅长遵循公司的语调、模板和设计规范,第一版产出就已经更接近团队可以直接拿来用的成品。

每一美元都做更多有用功

Astra 延续了我们一贯的承诺,用更高效率的模型,给客户更高的性价比。它在训练时就被要求用更少的 token 和更少的重试次数完成任务,单任务成本随之降了下来。在专业工作和代码类评测(包括 Terminal Bench 4.0 和 Artificial Analysis Intelligence Index)的成本效率前沿上,Astra 让 OpenAI 占据了大部分位置。起价为每百万输入 token 10 美元,每百万输出 token 50 美元。

1 of 4> 「Astra 在 DeepSWE v1.1 上以 74% 创下新纪录,这是前沿模型迄今用最少步骤和最高 token 效率取得的成绩,尤其在复杂的长时程任务上。可以肯定,这个模型将对高质量的真实软件工程产生显著影响。」
> , Serena Ge,Datacurve 联合创始人兼 CEO
>
> 「在我们的主动型智能体工作流里,Astra 把端到端耗时超过 5 小时的任务通过率提升了 20%,同时减少了完成任务所需的推理调用次数。模型决策能力的提升让我们可以省掉不少脚手架(scaffolding),进一步加快执行速度。」
> , Mitch Troyanovsky,Basis 联合创始人
>
> 「和我们的基线相比,Astra 多抓出了约 20% 的 bug。在需要跨文件深度推理才能发现细微问题的拉取请求(pull request)上,它的抓出率更是翻了一倍多。在代码审查中,它能把一处改动的意图和它的后果连起来。它会跨文件推理,捕捉接口契约漂移和权限漏洞,这些都是基线抓不到的,而且每一条结论都附带具体的验证步骤。」
> , David Loker,CodeRabbit 副总裁(AI)
>
> 「过去几个月里 AI 数学研究能力的跃升让人着迷。我们正处在一个新模型不断推动前沿的时代。Astra 又是一次显著的进步,我预期未来两年的进展速度还会大幅加快。」
> , Alex Gerko,XTX Markets CEO Datacurve、Basis、CodeRabbit、XTX Markets

更强的安全与控制,匹配关键性更高的工作

让 AI 接入业务系统,前提是要对它的「如何行动」有信心。正是基于这一点,Astra 是我们迄今为止对齐程度最高的模型,对人类意图和授权的遵循都更强。

训练期间,我们在内部计算机使用安全基准上对 Astra 进行了测试。该基准专门考察最棘手的业务场景,比如泄露机密信息、把仪表盘分享得过广、删除数据等等。在这项评测中,Astra 产生非预期结果的频率比 GPT‑5.6 Sol 低 89%,比 Claude Fable 5.1 低 74.7%。在 GPT‑6 Astra 和 GPT‑5.6 Sol 上加入额外的确认环节和自动化审查之后,两者的表现还进一步得到了提升。

企业也可以自己决定 Astra 的部署范围。新的企业管理控件允许它们把访问权限限制在经审批的网站和桌面应用范围内,管理上传与下载,并控制浏览历史。ChatGPT Work 和 Codex 还内置了若干保障机制,包括「确认策略」(confirmation policies),可在执行关键动作前要求人工批准,以及对潜在不安全或未授权工具调用的自动化审查。这些控制让团队可以从受限配置起步,再随时间逐步放宽访问限制。

为了进一步扩展接入方式,我们还在 ChatGPT Desktop 中随 Astra 同步推出了新的企业插件。这些插件由最新的浏览器使用(browser use)能力驱动,来自 Oracle Analytics、Power BI(Microsoft Fabric 的一项服务)、Navan 和 Avalara,让接入常见的企业应用变得更轻松。

Astra 也是首个在我们 Preparedness Framework 下达到「关键网络安全能力等级」(Critical cybersecurity capability threshold)的模型。

伴随能力提升,我们也在「误用」以及「模型擅自行动」两方面加强了防护。我们训练 Astra 严格遵守安全和权限边界,提升它抵御绕过安全措施企图的能力,并部署自动化检查以阻断有害输出。

原文配图