OpenAI 为 Codex、ChatGPT Work 付费用户集体"回血":修复 8 类烧额度 Bug,同样额度多干 10%-50% 的活

OpenAI 为 Codex、ChatGPT Work 付费用户集体"回血":修复 8 类烧额度 Bug,同样额度多干 10%-50% 的活
摘要:当地时间 8 月 29 日,OpenAI Codex 负责人 Tibo 在社交平台宣布,为所有 Codex 和 ChatGPT Work 付费用户重置使用额度。这不是一次简单的促销式加量——同一轮公告里,团队一次性公布了 8 类已修复的异常消耗问题,并给出预期...

OpenAI 为 Codex、ChatGPT Work 付费用户集体"回血":修复 8 类烧额度 Bug,同样额度多干 10%-50% 的活

额度没变,能干的活变多了。

当地时间 8 月 29 日,OpenAI Codex 负责人 Tibo 在社交平台宣布,为所有 Codex 和 ChatGPT Work 付费用户重置使用额度。这不是一次简单的促销式加量——同一轮公告里,团队一次性公布了 8 类已修复的异常消耗问题,并给出预期:按使用方式不同,同样的额度现在可以比之前多撑 10% 至 50%。

Tibo 的说法是,团队最近集中处理了数千份用户反馈,把 Codex 背后的用量计算机制翻了一遍。结论有点扎心:用户觉得额度不经用,不完全是错觉。

这份清单几乎可以当成一份「AI Agent 是怎么偷偷烧 Token 的」大全来读。里面没有一条是模型变笨了,全是你看不见的地方在漏水。

一、不是多送,是把漏的补上

要先说清楚一件事:这次不是把套餐额度翻倍。

Codex 给付费用户分配的是周额度(weekly quota),重置动作覆盖全部 Codex 与 ChatGPT Work 付费订阅。真正的变化发生在额度消耗那一侧——修复了后台的无效消耗之后,同样的数字变得耐用。

这解释了一个反常识的现象:过去几个月,社区里关于「什么都没干额度就没了」的抱怨越来越多,但 OpenAI 一度没有公开回应。直到这次把 8 类问题一次性摊开,用户才发现,钱不是花在你让 Agent 干的活上,而是花在 Agent 自己干的活上。

对按周付费的团队来说,这是一个相当实际的差别。10% 意味着一周多出半天有效工时,50% 意味着同样一份订阅能多跑近一半任务——而账单不变。

二、8 类 Bug,一份烧 Token 大全

第一类出在上下文压缩(Compaction)。Agent 跑久了上下文会膨胀,系统通常会压缩历史信息以便继续工作。但 Codex 此前的实现会把旧图片继续留在上下文里,结果压缩并没有把上下文变小,大到一定程度又立刻触发下一次压缩。为了省上下文而做的压缩,本身开始消耗更多上下文。修掉之后,重度使用图片的用户相关用量下降约 10%。

第二类在任务目标机制(/goal)。部分情况下,用户设定的目标明明已经完成,Agent 却没有按预期停下;另一种情况是工具已经坏了,模型仍在反复重试。任务表面结束,AI 在后台一遍遍干活。

第三类在 Memory。后台的 Memory Worker 有时会继承 Stop Hook,而 Stop Hook 本是用来控制任务何时停止的。条件无法满足时,后台任务反而可能一直跑下去。

第四类出在子智能体(Subagent)。一些能力较小的模型,比如 Luna,会在用户没有明确要求的情况下自行调用更强、更贵的辅助模型;更离谱的是,主模型没有运行在 /fast 模式,它也可能要求子 Agent 用 /fast。

第五类是自动化任务(Automations)的实际执行频率高于用户设置的频率。第六类是 Computer History 重复总结高度重叠的历史活动。第七类是 Rolling Task Summaries 在普通对话轮次也触发额外后台请求。第八类在 MCP 工具调用上,部分工具返回结果被重复编码两次,工具说明被截断后还要重新获取一次。

核心数据一览

三、20%、70% 与 15000 次

如果只是「每个省 1%」,这件事不值得写。真正让这份清单有分量的,是里面几个具体到刺眼的数字。

最狠的是 /goal 那一类。据 OpenAI 公布,他们观察到的一些案例中,仅仅这一个异常就能消耗掉用户每周额度的 15% 至 70%。也就是说,极端情况下,一个跑飞的任务可以吃掉你七成周额度,而你毫不知情。

其次是 Computer History。为了让 Agent 理解自己之前在电脑上做过什么,系统需要保存、整理甚至总结历史操作。旧版本会重复总结已经高度重叠的活动,相当于同一段工作日志一遍遍重新整理。OpenAI 称,部分案例里这部分开销能占到用户每周总用量的约五分之一,也就是 20%。

最夸张的长尾来自 Memory。这类问题影响的用户不到 1%,但 OpenAI 提到他们发现过一个案例:系统检查「某任务是否可以结束」这个动作,被执行了多达 15000 次。对绝大多数用户来说这个 Bug 完全无感,对撞上的用户来说,Token 就在后台无声蒸发——像电脑什么都没打开,风扇却开始狂转。

相比之下,Rolling Task Summaries 每次只多约 1% 的 Token 开销,看起来微不足道。但这是一个每次对话都来的 1%,OpenAI 的做法是直接关掉整个机制。

四、一笔越来越难算的账

把这 8 类问题放在一起看,暴露的是 Agent 产品的一个结构性难题。

过去用 ChatGPT,用户基本可以把一次对话理解成一次模型调用:你输入一句,模型回一句,消耗大体可估。到了 Codex 这类产品里,你在界面上只敲了一行字,系统看到的是一整条 Agent 工作流——主模型、子 Agent、外部工具、记忆 worker、上下文压缩、自动化调度、后台摘要,全都可能产生模型活动。

有些 Token 真的拿去写代码了,有些用来理解上下文,还有一些只是后台在维护记忆、生成摘要或调度 Agent。任何一环出现循环、重复调用或错误调度,用户最终感受到的就只有一件事:怎么什么都没干,额度就没了?

OpenAI 显然意识到了这一点。除了修复 Bug,团队表示已做了架构层面调整以防复发,并为异常配置了自动告警。更重要的是,他们正在开发应用内的用量展示功能,未来用户可以直接看到额度花到了哪里,而不用靠猜。

不过社区并不完全买账。有用户指出,光 Computer History 一项就能吃掉 20% 周额度,说明此前的浪费规模被低估了;也有人抱怨这次重置的窗口只有 5 小时,太短。

趋势与结构拆解

五、对手在隔壁

这轮动作的时间点,很难说是巧合。

就在同一周,OpenAI 宣布将于 11 月 12 日终止向 Cursor 提供模型的直接接入,理由是 SpaceX 收购 Cursor 母公司 Anysphere 触发了合同中的控制权变更条款,且不再向其提供未来新模型。Cursor CEO Michael Truell 回应称,OpenAI 模型约占平台用户流量的 5%。双方关系骤然紧张。

几乎同时,Anthropic 宣布自 9 月 14 日起,Claude Code 的 Pro、Max、Team 及按席位计费的 Enterprise 套餐,标准每周额度永久提高 25%。但这里有个容易被忽略的细节:在此之前用户享受的是临时提高 50% 的额度,因此新标准落地后,每周可用额度相比当前实际水平反而下降约 17%。Anthropic 也承认了这一点,并表示正在准备新的使用体验调整。

三件事叠在一起,指向同一个竞争维度:Agent 产品的战场,已经从「模型多强」转向「单位额度能干多少活」。模型能力在趋同,额度的确定性正在成为新的差异化。

所以,这次重置额度或许只是表面福利。真正的考验是:当 OpenAI 把用量明细摆到用户面前,那笔账到底是变清楚了,还是变得更难看了?到那时,答案才会真正浮出水面。

卖家应对与观察方向