面向Google编程CHARLES ZHANG

AI DAILY / 2026-09-08

OpenAI 发布 GPT-6 Astra,对标 Claude Fable 5

GPT‑6 Astra

上下文与记忆Simon Willison · 2026-09-03

中文翻译 · AI 生成,仅供学习交流

GPT‑6 Astra

GPT-6 Astra 正在「于今日开始向一小部分组织推出,并在未来几天内向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时也通过 OpenAI API 和 AWS 提供」。我本人还没用过,暂时没什么可说的。

API 定价与 Claude Fable 5 和 5.1 相同,输入 $10/百万 token,输出 $50/百万 token。这明显是 OpenAI 对标 Fable 的产品,在 OpenAI 自家公布的大部分基准测试(benchmark)上得分都高于 Fable。

最亮眼的是 Astra 在 ARC-AGI 3 基准测试(三月刚发布)上拿到了 99.9%。不过 Fable 5 至今还没公布成绩。ARC-AGI 博客提到,这个 99.9% 是用 OpenAI 自定义的「Provider Adapter harness」(Provider Adapter 测试框架)跑出来的,成本 $19K;用默认框架花 $26K 只能拿到 62.7%。Provider Adapter 测试框架会在多次请求之间保留不透明的推理状态(opaque reasoning state),长对话时还会做压缩(compaction),让模型能复用之前的工作。

考虑到最近 Hugging Face 那次事件,Astra 在安全任务上这么猛也就不意外了(译注:指 Hugging Face 平台近期曝出的提示注入安全事件,多个主流模型被绕过防护)。ExploitBench 上拿到 100%(GPT-5.6 Sol 是 78.5%),ExploitGym 上拿到 42.4%(Sol 是 30.3%),SRE-Bench 二进制逆向工程任务里四次尝试内拿到 99.2%,Sol 是 68.7%。长上下文也更强,OpenAI 的「eight-needle」(八针探针)基准测试里,256K–512K token 时拿满 100%,512K–1M token 时拿 96.3%。OpenAI 也许真的解决了长上下文处理的一个老大难。

不过也不是什么都赢。Artificial Analysis 指出,他们的 Intelligence Index 上 Astra 还是被 Fable 压一头。GPT-6 Astra 在该指数上和 GPT-5.6 Sol 并列,都是 61 分,比 Claude Fable 5.1(max with fallback,即启用兜底机制的最大档)低 5 分,也落后于 Meta 新发布的 Muse Spark 1.3(max)。

Coding Agent Index 上就反过来了。GPT-6 Astra 在 max effort(最大算力)档位下,成本和 GPT-5.6 Sol(max)差不多,得分却高出 2 分。按单任务算,要拿到相同的得分,成本还不到 Claude Fable 5 的一半。

等我拿到访问权限再详细聊。API 正式开放后的模型标识符是 gpt-6-astra

Via Hacker News Tags: ai , openai , generative-ai , llms , llm-release , gpt-6-astra