博客

GPT-6 Astra 值不值 $10/$50?跨文件多抓 20%,简单任务只多抓 4%

CodeRabbit 的第三方评测里,GPT-6 Astra 的可执行发现覆盖整体只比 GPT-5.6 Sol 多抓约 4%,跨文件 review 这个更难的子集拉开到多抓 20%(同一子集对 Opus 5 是 33%)——五倍之差,而它的单价是 Sol 促销价的 2.5 倍。这两个数放在一起给出的不是「看情况」,是一条能当天核对的线:证据散不散。外加 OpenAI 自评与第三方读数为什么必须分开看,以及 Critical 网络安全评级带来的拒答成本。价格与读数均为 2026-09-05 采集。

Linden Kern约 7 分钟
一台机器左半是光滑外壳、右半是密集的齿轮管路;两侧各立一块板,一块画勾一块画叉。

先回答标题。只有当一个任务要求模型把散在多个文件、多份材料里的证据连起来,你才买得回这个价; 其余的活交给更便宜的模型。 依据是 CodeRabbit 在 9 月 4 日发布的评测:Astra 的可执行发现覆盖 整体只比 GPT-5.6 Sol 多抓 4%,在更难的跨文件 review 子集上拉开到 20%(同一子集对 Opus 5 是 33%)。 它的标价是 $10 / $50 每百万 token,是 Sol 促销价的 2.5 倍

限定先说在前面:CodeRabbit 自称这是「early, directional result」——早期的、方向性的结果。 它测的是一件具体的事,不是总排名。下面三节把这个数拆开,再给一份能当天核对的判据清单。

同一份评测里的两个数:整体多抓 4%,跨文件多抓 20%

先说清它在测什么。CodeRabbit 的指标是 actionable bug coverage——在一批已标注 bug 的 代码变更上,模型通过「开发者可以直接照着动手的发现」抓到了多少个。这不是代码质量总分, 也不是 review 好不好用的综合评价,是一个口径很窄的可数指标(GPT-6 Astra in code review: Gains, privacy, and cost)。

口径窄是优点:窄到可数,才谈得上「贵 2.5 倍换来什么」。

评测子集相对增益 · 对 GPT-5.6 Sol相对增益 · 对 Claude Opus 5
整体(含简单 review)约 +4%约 +22%
跨文件 review(更难的子集)+20%+33%

两行来自同一批评测、同一个指标,差别只在题的难度——都是相对增益,不是覆盖率的 百分点差,4% 到 20% 是五倍。CodeRabbit 对整体那行的解释是: 评测里也包含简单的 review,而在简单题上,更强的模型没有拉开差距的空间

这句解释就是本篇的判据来源。它说的不是「Astra 只强一点点」,而是「Astra 强在哪里, 取决于你给它什么题」。CodeRabbit 把这个能力概括为把一次改动的意图,和它散落在代码库 各处的后果连起来——变更单独看是对的,放回系统里却打坏别处,这类问题的证据天生分散。

CodeRabbit 另有两句限定值得原样搬过来:这些结果不构成 review 质量的总排名, 也不预测你团队的缺陷率。它能告诉你的是这类任务上存在可测差异, 你那条 pipeline 上的差异只能你自己跑。

OpenAI 自评的数字很漂亮,但它回答的不是「值不值」

发布当天流传最广的是另一组数字,出处是OpenAI 自己的发布材料——与上一节的第三方评测 不是一回事,不能混着读。

OpenAI 公布的读数里,OSWorld 2.0(操作电脑的能力)从 Sol 的 65.7% 提到 72.6%, 单个任务耗时从 75 分钟降到 40 分钟;ExploitBench 从 Sol 的 73.5% 到 100%OpenAI Launches GPT-6 Astra, Pricing, Benchmarks and Who Gets It First)。

这里值得停一下。ARC-AGI-3 这项,同一天的两篇报道对不上:launch 汇总记 98.6%, 且 Sol 那一格写的是「未公布」;Asia Business Daily 记的是最高 99.9%,还给了 Sol 的 7.8%GPT-6 Astra Performance Reviewed… Price Also Up 2.5 Times)。差的不只是小数点—— 一个源说没有对照值,另一个源有;而「最高」这个词本身也可能意味着多次运行取最好的一次。 我不替它们择一。把厂商自评当采购依据之前,先确认你读的是谁跑的、跑的哪一版、取的哪一次。

真正对「值不值」有话说的是第三方的两组读数,而且它们指向相反的方向:

读数(来源:Artificial Analysis)GPT-6 AstraClaude Fable 5.1
综合智能指数(max effort,越高越强)6166
每个 Coding Agent Index 任务的成本$4.72$9.18

综合指数上 Astra 落后,单任务成本上它便宜约 49%(读数经 GPT-6 Astra in Foundry: the price, the gate and the EU gap 转述)。Artificial Analysis 另有一句判断被 Asia Business Daily 引到:Astra 在综合智能指标上 与前代差别不大,而单价上涨使通用工作的性价比反而下降

三组数放在一起并不矛盾,它们只是回答了三个不同的问题:单价比 token,指数比综合能力, 任务成本比「跑完一件事总共花了多少」。OpenAI 总裁 Greg Brockman 在发布会上说 「按 token 定价没有意义……你真正要的是每个任务的价格」——这话对了一半。它成立的前提是 你测得到自己的 per-task 成本;测不到的时候,你手里唯一确定的数字还是那张价目表:2.5 倍。

该用 / 不该用:七条能当天核对的判据

把量化边界翻译成能对着自己的任务打勾的清单。判据是任务形态,不是重要性。

判据
证据分散在多个文件、多份材料里,且各部分之间有依赖关系(那 20% 就长在这里)
任务边界清楚、结果可被验收——判得出对错,才谈得上算省不省
你已经在测每个成功结果的总成本,而不是只盯单价
单文件、单轮、模板化的活:只多抓约 4%,买不起 2.5 倍单价
每轮都把同一份代码库/文档重新喂一遍的 agent 循环:账单大头不在模型单价上(见文末互链)
工作流里有安全敏感动作、且不能被中途打断的
上面几条都命中、但这类任务只占你账单一小部分:切换要重调 prompt、重跑评测集、新建拒答路径,这笔一次性成本要摊到那一小部分上

安全敏感那条要展开,它是这次发布里最容易被漏算的一笔成本。

Astra 是 OpenAI 第一个在自家 Preparedness Framework 里达到网络安全 Critical 档的模型, 代价是它拒答得更多——对已知越狱手法的拒绝率 91.5%,Sol 是 59%。 OpenAI 自己承认上线初期的误触发高于其预期,并承诺后续调整过滤器。 更要紧的是两种产品形态下的表现不同——在 ChatGPT 和 Codex 里,用户会先看到一个确认提示; 在 API 里,任务会被直接终止,且没有预警。如果你的 pipeline 里有漏洞排查、安全加固、 日志分析这类靠近红线的活,请预算一条拒答处理路径,并把拒答记进日志。

还有一条判据在能力之外:你拿不拿得到。在 Microsoft Foundry 上 Astra 走 Limited Access 审批,审核 5 到 10 个工作日,用个人邮箱提交的申请会被拒;发布时没有 EU Data Zone, Global 与 US 两档之外没有欧盟境内处理的选项。OpenAI 侧同样分阶段放量。 「值不值」在拿不到的时候是个空问题——先确认档期,再算这笔账。

收束:用你最贵的那条 workload 去测,而不是用这篇文章

清单只能排除掉明显不该切的那一半。剩下的,唯一有意义的动作是并排跑一次。

挑出你手上单位成本最高的那条 workload,用同一批任务、同一套工具让 Sol 和 Astra 各跑一遍, 记三个数:答案质量、人工复核花掉的时间、每个成功结果的总成本

CodeRabbit 自己的建议也是从边界清楚、答案可核对的活开始试。它自己都没把 Astra 在代码 review 外的场景测过——那部分正好是你的活。


延伸阅读Is GPT-6 Astra worth $10/$50?(en 刊全表)· 同价不同账,差在 cache read · Fable 5.1 把缓存读取砍到四分之一

价格与读数均为 2026-09-05 采集:Astra $10 / $50 每百万 token(Fast 模式翻倍), Sol 促销价 $4 / $20,至少持续到 2026-11-21。