# GPT-6 Astra 值不值 $10/$50？跨文件多抓 20%，简单任务只多抓 4%

> CodeRabbit 的第三方评测里，GPT-6 Astra 的可执行发现覆盖整体只比 GPT-5.6 Sol 多抓约 4%，跨文件 review 这个更难的子集拉开到多抓 20%（同一子集对 Opus 5 是 33%）——五倍之差，而它的单价是 Sol 促销价的 2.5 倍。这两个数放在一起给出的不是「看情况」，是一条能当天核对的线：证据散不散。外加 OpenAI 自评与第三方读数为什么必须分开看，以及 Critical 网络安全评级带来的拒答成本。价格与读数均为 2026-09-05 采集。

- Published: 2026年9月5日
- Author: Linden Kern, Chief Scientist
- Tags: models, cost, coding-agents
- Canonical: https://pirouter.ai/zh/blog/astra-worth-the-price

---
先回答标题。**只有当一个任务要求模型把散在多个文件、多份材料里的证据连起来，你才买得回这个价；
其余的活交给更便宜的模型。** 依据是 CodeRabbit 在 9 月 4 日发布的评测：Astra 的可执行发现覆盖
整体只比 GPT-5.6 Sol 多抓 **4%**，在更难的**跨文件** review 子集上拉开到 **20%**（同一子集对 Opus 5 是 33%）。
它的标价是 $10 / $50 每百万 token，是 Sol 促销价的 **2.5 倍**。

限定先说在前面：CodeRabbit 自称这是「early, directional result」——**早期的、方向性的结果**。
它测的是一件具体的事，不是总排名。下面三节把这个数拆开，再给一份能当天核对的判据清单。

## 同一份评测里的两个数：整体多抓 4%，跨文件多抓 20%

先说清它在测什么。CodeRabbit 的指标是 **actionable bug coverage**——在一批已标注 bug 的
代码变更上，模型通过「开发者可以直接照着动手的发现」抓到了多少个。这不是代码质量总分，
也不是 review 好不好用的综合评价，是一个口径很窄的可数指标（[GPT-6 Astra in code review:
Gains, privacy, and cost](https://www.coderabbit.ai/blog/gpt-6-astra-code-review-evaluation)）。

口径窄是优点：窄到可数，才谈得上「贵 2.5 倍换来什么」。

| 评测子集 | 相对增益 · 对 GPT-5.6 Sol | 相对增益 · 对 Claude Opus 5 |
|---|---|---|
| 整体（含简单 review） | 约 +4% | 约 +22% |
| 跨文件 review（更难的子集） | +20% | +33% |

两行来自同一批评测、同一个指标，差别只在题的难度——**都是相对增益，不是覆盖率的
百分点差**，4% 到 20% 是五倍。CodeRabbit 对整体那行的解释是：
评测里也包含简单的 review，而**在简单题上，更强的模型没有拉开差距的空间**。

这句解释就是本篇的判据来源。它说的不是「Astra 只强一点点」，而是「Astra 强在哪里，
取决于你给它什么题」。CodeRabbit 把这个能力概括为**把一次改动的意图，和它散落在代码库
各处的后果连起来**——变更单独看是对的，放回系统里却打坏别处，这类问题的证据天生分散。

CodeRabbit 另有两句限定值得原样搬过来：这些结果**不构成 review 质量的总排名**，
也**不预测你团队的缺陷率**。它能告诉你的是这类任务上存在可测差异，
你那条 pipeline 上的差异只能你自己跑。

## OpenAI 自评的数字很漂亮，但它回答的不是「值不值」

发布当天流传最广的是另一组数字，出处是**OpenAI 自己的发布材料**——与上一节的第三方评测
不是一回事，不能混着读。

OpenAI 公布的读数里，OSWorld 2.0（操作电脑的能力）从 Sol 的 65.7% 提到 **72.6%**，
单个任务耗时从 75 分钟降到 **40 分钟**；ExploitBench 从 Sol 的 73.5% 到 **100%**
（[OpenAI Launches GPT-6 Astra, Pricing, Benchmarks and
Who Gets It First](https://pasqualepillitteri.it/en/news/14246/openai-launches-gpt-6-astra-pricing-benchmarks)）。

这里值得停一下。ARC-AGI-3 这项，同一天的两篇报道对不上：launch 汇总记 **98.6%**，
且 Sol 那一格写的是「未公布」；Asia Business Daily 记的是**最高 99.9%**，还给了 Sol 的
**7.8%**（[GPT-6 Astra Performance Reviewed… Price Also Up 2.5
Times](https://www.asiae.co.kr/en/article/2026090415280432886)）。差的不只是小数点——
一个源说没有对照值，另一个源有；而「最高」这个词本身也可能意味着多次运行取最好的一次。
我不替它们择一。**把厂商自评当采购依据之前，先确认你读的是谁跑的、跑的哪一版、取的哪一次。**

真正对「值不值」有话说的是第三方的两组读数，而且它们指向相反的方向：

| 读数（来源：Artificial Analysis） | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| 综合智能指数（max effort，越高越强） | 61 | 66 |
| 每个 Coding Agent Index 任务的成本 | $4.72 | $9.18 |

综合指数上 Astra 落后，单任务成本上它便宜约 49%（读数经 [GPT-6 Astra in Foundry: the price,
the gate and the EU gap](https://technspire.com/en/blog/gpt-6-astra-foundry-price-gate-eu-gap)
转述）。Artificial Analysis 另有一句判断被 Asia Business Daily 引到：Astra 在综合智能指标上
与前代差别不大，而**单价上涨使通用工作的性价比反而下降**。

三组数放在一起并不矛盾，它们只是回答了三个不同的问题：单价比 token，指数比综合能力，
任务成本比「跑完一件事总共花了多少」。OpenAI 总裁 Greg Brockman 在发布会上说
「按 token 定价没有意义……你真正要的是每个任务的价格」——这话对了一半。**它成立的前提是
你测得到自己的 per-task 成本**；测不到的时候，你手里唯一确定的数字还是那张价目表：2.5 倍。

## 该用 / 不该用：七条能当天核对的判据

把量化边界翻译成能对着自己的任务打勾的清单。判据是**任务形态**，不是重要性。

| | 判据 |
|---|---|
| ✓ | 证据分散在多个文件、多份材料里，且各部分之间有依赖关系（那 20% 就长在这里） |
| ✓ | 任务边界清楚、结果可被验收——判得出对错，才谈得上算省不省 |
| ✓ | 你已经在测每个成功结果的总成本，而不是只盯单价 |
| ✗ | 单文件、单轮、模板化的活：只多抓约 4%，买不起 2.5 倍单价 |
| ✗ | 每轮都把同一份代码库/文档重新喂一遍的 agent 循环：账单大头不在模型单价上（见文末互链） |
| ✗ | 工作流里有安全敏感动作、且不能被中途打断的 |
| ✗ | 上面几条都命中、但这类任务只占你账单一小部分：切换要重调 prompt、重跑评测集、新建拒答路径，这笔一次性成本要摊到那一小部分上 |

安全敏感那条要展开，它是这次发布里最容易被漏算的一笔成本。

Astra 是 OpenAI 第一个在自家 Preparedness Framework 里达到**网络安全 Critical 档**的模型，
代价是它拒答得更多——对已知越狱手法的拒绝率 91.5%，Sol 是 59%。
OpenAI 自己承认上线初期的误触发**高于其预期**，并承诺后续调整过滤器。
更要紧的是两种产品形态下的表现不同——在 ChatGPT 和 Codex 里，用户会先看到一个确认提示；
**在 API 里，任务会被直接终止，且没有预警**。如果你的 pipeline 里有漏洞排查、安全加固、
日志分析这类靠近红线的活，请预算一条拒答处理路径，并把拒答记进日志。

还有一条判据在能力之外：**你拿不拿得到**。在 Microsoft Foundry 上 Astra 走 Limited Access
审批，审核 5 到 10 个工作日，用个人邮箱提交的申请会被拒；发布时没有 EU Data Zone，
Global 与 US 两档之外没有欧盟境内处理的选项。OpenAI 侧同样分阶段放量。
「值不值」在拿不到的时候是个空问题——先确认档期，再算这笔账。

## 收束：用你最贵的那条 workload 去测，而不是用这篇文章

清单只能排除掉明显不该切的那一半。剩下的，唯一有意义的动作是并排跑一次。

挑出你手上单位成本最高的那条 workload，用同一批任务、同一套工具让 Sol 和 Astra 各跑一遍，
记三个数：**答案质量、人工复核花掉的时间、每个成功结果的总成本**。

CodeRabbit 自己的建议也是从边界清楚、答案可核对的活开始试。它自己都没把 Astra
在代码 review 外的场景测过——那部分正好是你的活。

---

**延伸阅读**：[Is GPT-6 Astra worth $10/$50?](/blog/astra-eval-worth-the-price)（en 刊全表）·
[同价不同账，差在 cache read](/zh/blog/astra-fable-same-bill) ·
[Fable 5.1 把缓存读取砍到四分之一](/zh/blog/fable-5-1-cache-read-bill-share)

价格与读数均为 2026-09-05 采集：Astra $10 / $50 每百万 token（Fast 模式翻倍），
Sol 促销价 $4 / $20，至少持续到 2026-11-21。

---

## Sources

### coderabbit.ai

- [GPT-6 Astra in code review: Gains, privacy, and cost](https://www.coderabbit.ai/blog/gpt-6-astra-code-review-evaluation)

### pasqualepillitteri.it

- [OpenAI Launches GPT-6 Astra, Pricing, Benchmarks and Who Gets It First](https://pasqualepillitteri.it/en/news/14246/openai-launches-gpt-6-astra-pricing-benchmarks)

### asiae.co.kr

- [GPT-6 Astra Performance Reviewed… Price Also Up 2.5 Times](https://www.asiae.co.kr/en/article/2026090415280432886)

### technspire.com

- [GPT-6 Astra in Foundry: the price, the gate and the EU gap](https://technspire.com/en/blog/gpt-6-astra-foundry-price-gate-eu-gap)
