AI DAILY / 2026-09-08
GPT-6 Astra定价与基准:直指Claude Fable
GPT‑6 Astra
中文翻译 · AI 生成,仅供学习交流
GPT‑6 Astra
GPT-6 Astra 正在「今天向一部分机构开放,未来几天内将面向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时通过 OpenAI API 和 AWS 提供」。我目前还没亲自试用过,所以还谈不上有太多看法。
API 定价将与 Claude Fable 5、5.1 持平,输入 $10/百万 token,输出 $50/百万 token。这显然是 OpenAI 对标 Fable 的产品,在 OpenAI 自己公布的大多数基准测试上,得分看起来也比 Fable 高。
最惊艳的是,Astra 在今年 3 月发布的 ARC-AGI 3 基准测试上拿到了 99.9%。不过 Fable 5 还没公布该基准的成绩。ARC-AGI 的博客提到,这个 99.9% 是 OpenAI 用自家定制的 Provider Adapter harness 跑出来的,花了 $19K;换成默认的 ARC-AGI harness,得分就只有 62.7%,成本是 $26K。Provider Adapter harness 在请求之间保留不透明的推理状态(reasoning state),对较长对话做压缩(compaction),让模型可以复用之前的工作。
考虑到最近的 Hugging Face 事件,Astra 在安全任务上表现强悍也就不意外了。它在 ExploitBench 上拿到 100%(GPT-5.6 Sol 是 78.5%),ExploitGym 上 42.4%(Sol 是 30.3%),SRE-Bench 二进制逆向工程四次尝试内 99.2%,Sol 只有 68.7%。长上下文方面也更强,OpenAI 的 eight-needle 基准测试里,256K–512K token 拿下 100%,512K–1M token 是 96.3%。OpenAI 可能已经攻克了长上下文处理中长期存在的一道难题。
不过也不是样样都强。Artificial Analysis 指出,在他们自家 Intelligence Index 上,Astra 还是被 Fable 压过一头。Intelligence 维度,GPT-6 Astra 与 GPT-5.6 Sol 并列,Index 得分都是 61。比 Claude Fable 5.1(fallback 模式下的最大值)低 5 分,也落后于 Meta 刚刚发布的 Muse Spark 1.3(最大值)。但在他们的 Coding Agent Index 上表现更好,领跑了 Coding Agent Index 的成本效率前沿。最大算力档位下,GPT-6 Astra 成本和 GPT-5.6 Sol(最大值)差不多,Index 得分却高出 2 分。按每个任务算,分数相同的情况下,成本不到 Claude Fable 5 的一半。
等我拿到访问权限,再多写一些关于 Astra 的东西。正式上线后,API 模型标识是 gpt-6-astra。