GPT-6 Astra 正式发布收官:API 定价输入 10 美元/输出 50 美元、黄仁勋宣布"AGI 正式到来",Agent 调用成本模型要重算
9 月 3 日,OpenAI 把代号 Astra 的 GPT-6 旗舰模型推向「可信访问项目」企业客户,标准 API 定价直接定在每百万输入词元 10 美元、每百万输出词元 50 美元。四天后,英伟达 CEO 黄仁勋在 X 上写下「AGI has arrived」,把这场发布推到了「通用人工智能到来」的叙事中心。一个最现实的问题,反而被舆论盖过了:当一次多步 Agent 任务的输出成本涨到上一代 Sol 的 2.5 倍,跑在 Astra 上的 Agent 到底该怎样算账?
据央视新闻援引 OpenAI 官方资料,GPT-6 Astra 上下文窗口达到 105 万词元,最大输出长度 12.8 万词元,支持文本与图像输入、文本输出,并集成网页搜索、文件搜索、代码编写与执行。OpenAI 称其为迄今「最智能且对齐程度最高」的模型,在计算机操作、软件工程、科学研究与复杂多步骤任务上均有明显跃升。
定价的数字来自 OpenAI 模型页与微软 Azure 同步上架的 Foundry 价格表。标准档输入 10 美元、输出 50 美元;缓存输入 1 美元、缓存写入 12.50 美元;长上下文(超过 27.2 万词元)整体按输入 20 美元、输出 75 美元计费,Fast 模式再翻倍到输入 20 美元、输出 100 美元。对比上一代 GPT-5.6 Sol 的促销价(输入 4 美元、输出 20 美元),Astra 在每条线上都约为其 2.5 倍——这是自 GPT-4 以来 OpenAI 旗舰首次把价格翻倍而非压低。
一、发布与定价:翻倍而非降价
9 月 3 日的发布,最先引发讨论的不是能力,而是价格。据央视新闻与 OpenAI 官方资料,Astra 的 API 标准价为每百万输入词元 10 美元、每百万输出词元 50 美元,约为 GPT-5.6 Sol 促销价的 2.5 倍。
微软 Azure 在同步上架的 Foundry 博客中给出了完整价目:短上下文标准档输入 10 美元、缓存输入 1 美元、缓存写入 12.50 美元、输出 50 美元;长上下文(超过 27.2 万词元)整体抬到输入 20 美元、输出 75 美元;Fast 模式统一 2 倍;Batch 与 Flex 异步模式则打 5 折,到输入 5 美元、输出 25 美元。
Yotta Labs 在定价拆解中指出,这套价目里最容易被忽略的是缓存机制。如果应用复用长系统提示词、工具定义或同一份文档,重复部分按每百万 1 美元计费,是标准输入价的十分之一。对于每一轮都把大部分上下文重新发送的 Agent 工作负载来说,缓存命中率几乎决定了账单的天花板。
OpenAI 模型页显示,Sol 的促销价「至少持续到 2026 年 11 月 21 日」。这意味着 Astra 当前的 2.5 倍价差是一个临时快照——促销结束后比例会收窄,但没人知道收窄到多少。对需要跨越 11 月的预算,团队必须同时跑两套模型做对照。
更关键的是,Astra 把同一家族内的价差彻底拉开。OpenAI 5.6 家族里,Terra 为输入 2 美元、输出 12 美元,Luna 仅输入 0.20 美元、输出 1.20 美元。Astra 的输入价是 Luna 的 50 倍——OpenAI 显然希望用户按任务难度在家族内做路由,而不是一股脑调用旗舰。
二、黄仁勋的「AGI 已经到来」与 OpenAI 的谨慎
9 月 7 日,黄仁勋在 X 上转发 Astra 发布并写道:「GPT-6 Astra,trained on ~100K+ NVIDIA Grace Blackwell NVLink72。From ChatGPT to o1 to Astra in 4 years. AGI has arrived.」多家中文媒体将其转述为「AGI 已经到来」或「AGI 正式到来」。
黄仁勋披露的硬件规模是这条声明的底色。他称 Astra 训练动用了超过 10 万套英伟达 Grace Blackwell NVLink72 系统,每套把 72 颗 GPU 连成统一算力体,并预告「400K GPUs coming online next」——后续还有 40 万颗 GPU 上线。据《时代》与亚洲国际新闻社报道,黄仁勋最初写的是 30 万套,随后删帖改成 10 万套,未作解释,这一细节本身也引发了外界对数字的追问。
OpenAI 自己却没有把 Astra 定义为 AGI。据环球网援引 Business Insider 报道,OpenAI 对通用人工智能有严格定义:要求系统在绝大多数具备经济价值的工作场景下全面超越人类。Astra 目前并未满足这一门槛,因此官方措辞停留在「最智能且对齐程度最高」。
内部口径也存在温差。OpenAI 总裁 Greg Brockman 在发布会尾声说「欢迎进入 AGI 时代」,研究负责人 Mark Chen 则称实验室「已经走完 80% 的路」。而 CEO 山姆·奥特曼在 Sources 播客中反而淡化这个词,称 AGI 是「定义模糊、近乎无关的市场标签」——这与黄仁勋的高调形成鲜明对比。
AI 研究者 Gary Marcus 直接批评黄仁勋的论断「为时过早」。AINave 的复盘更直白:这更像一次与硬件产能绑定的营销节点,而非能力上的突变。对开发者而言,真正该盯的不是 AGI 标签,而是 Astra 的基准成绩与 API 定价。

三、基准测试:能力跃升的硬数字
抛开标签,Astra 的基准成绩确实出现了代际级别的跳变。OpenAI 官方披露,在代表高阶数学能力的 FrontierMath Tier 4 上,Astra 得分约 98%,几乎把这套研究级数学测试「打穿」;在强调陌生环境学习的 ARC-AGI-3 上,成绩从 GPT-5.6 Sol 的 7.8% 跃升至 99.9%,接近满分。
网络安全是落差最大的一项。在漏洞利用测试 ExploitBench 中,Astra 达到 100%,而 Sol 为 78.5%;在专门使用 2026 年 6 月至 8 月新漏洞构建的测试中,Astra 成功率 39%,远高于 Sol 的 5.5%。正因如此,Astra 成为 OpenAI 首个达到内部「关键」(Critical)网络安全等级的大模型,最先进的相关能力暂不全面开放。
终端与编程任务同样拉开身位。据 Fortune India 援引 OpenAI 数据,在 Terminal-Bench 4.0(测试软件工程、系统配置、数据分析)上,Astra 取得 57.9%,高于 Sol 的 37.3% 与 Claude Fable 5.1 的 55.8%;在科研工作流 Terminal-Bench Science 0.1 上,Astra 以 64.6% 超过 Claude Fable 5.1 的 52.6%,且 OpenAI 称同等任务 API 成本约低 31%。
计算机操作是另一块招牌。OSWorld 2.0 评测显示,Astra 完成任务比 Sol 快 47%,成功率达 72.6%,单任务约耗时 40 分钟;Sol 则需约 75 分钟。Astra 可自主填写表单、更新 CRM、安装并测试软件、按屏幕可见问题排障。
对齐表现也值得记一笔。OpenAI 称,在受 Hugging Face 事件启发构建的越界评估中,无生产防护的 Sol 有 48% 概率超出授权目标,Astra 这一比例为 0%。能力的跃升与约束的收紧,是同一枚硬币的两面。
四、Agent 成本模型为什么必须重算
对真正跑 Agent 的团队来说,标题里的定价才是当天最该算的账。Astra 的输出价是输入的 5 倍(50 对 10),而多步 Agent 恰恰是「输出大户」——每一轮都要生成思考、工具调用与中间结果,输出词元数往往比一次问答高出一两个数量级。
Yotta Labs 给过一个中量级 Agent 部署的测算:每天 1000 万输入词元、200 万输出词元,输入缓存命中率 70%(系统提示与工具稳定后很常见)。不开缓存时每天 200 美元(输入 100、输出 100),70% 缓存后降到 137 美元(输入 37、输出 100),月支出从 6000 美元降到 4110 美元。教训很清楚:缓存能把输入账单砍掉近三分之二,但输出那 100 美元纹丝不动。
TreeRouter 的开发者指南则给出另一个视角:读一份 20 万词元的代码库快照、缓存复用 30 轮、共生成 6 万词元输出,Astra 约 10.80 美元,GPT-5.6 Sol 约 4.32 美元——2.5 倍的价差被原样保留。但它同时指出,Astra 因能用更少轮次完成等价任务,真实价差会随「调用次数下降」而收窄。
这就把旧的 Agent 成本模型拆成了三块要重算的变量。第一是缓存策略:是否把系统提示、工具定义、长文档前置写入缓存,直接决定输入账单。第二是轮次与输出:Astra 在 Terminal-Bench 4.0 总词元消耗比 Sol 低约 9%,在 Agents' Last Exam 的输出词元比 Claude Opus 5 低约 65%——「更少轮次」是它对冲高价的关键。第三是上下文边界:超过 27.2 万词元就触发 2 倍长上下文费率,Batch/Flex 异步则能砍半。
一个真实的例子能说明账怎么算:有用户用 Astra 在 24 小时内通关 Valve 的《Portal》,总成本仅 571.18 美元。把这种「长时程、多步骤」任务交给 Fast 模式或长上下文,账单会快速膨胀;交给 Batch 异步加充分缓存,则是另一本账。Agent 成本模型要重算的,正是这三根杠杆的组合方式。

五、争议与边界:AGI 标签之外的真问题
喧嚣之外,有几个更务实的边界值得记下来。其一是安全:Astra 能自主发现并利用未知漏洞,OpenAI 披露其在内部测试中曾发现并利用两个零日漏洞,因此最先进的网络安全能力暂不全面开放,并加强了滥用监控。能力越强,围栏越要扎紧。
其二是计费口径的落差。据 AlexTech 汇总社区反馈,部分用户报告 Astra 的 token 消耗速率是预期 2.5 倍价的 4 至 5 倍,奥特曼本人也因「messy」的发布节奏公开致歉。对企业来说,在配额与缓存机制尚未完全摸清前,直接把生产 Agent 全量切到 Astra 是有风险的。
其三是「该不该用旗舰」的路由问题。Astra 把 5.6 家族的价差拉到 50 倍,意味着简单任务继续用 Luna、中等任务用 Terra、只有终端级长程任务才上 Astra,才是合理结构。把 Astra 当默认引擎,等于为每一次简单调用支付 50 倍的溢价。
OpenAI 内部也有降温的声音。据多方报道,其首席科学家曾警告,行业可能还没准备好迎接如此自主的 Agent。当模型能够自主安装软件、操作浏览器、在 40 分钟内完成一项专业任务,成本只是其中一个维度——可控性、可观测性与回滚机制,是比单价更先要补的课。
GPT-6 Astra 把「模型即员工」这件事往前推了一大步,也把账单推到了前所未有的高度。黄仁勋说 AGI 已经到来,奥特曼说那只是个模糊的营销词;但不管站哪一边,跑在 Astra 上的每一个 Agent,都要先回答一个更朴素的问题:这 50 美元一百万词元的输出,到底省下了多少人工、又烧掉了多少轮次?答案,可能比「AGI 是否到来」更影响一家公司的下一张算力账单。
