← 返回内容列表

OpenAI 静默缩减 Codex 上下文:372K 到 272K 的成本权衡

OpenAI 静默缩减 Codex 上下文:372K 到 272K 的成本权衡

OpenAI 在 2026 年 7 月将 Codex 上下文窗口从 372K 静默缩减到 272K tokens(27% 削减),未提前公告。配合内部推理算力参数 "juice" 从 960 降到 128,编程场景单轮 token 消耗降低 50%+。这是 OpenAI 在 Codex 流量翻倍压力下"优先保用户数而非单用户深度"的工程选择。

2026 年 7 月 13 日,一位 Codex 用户发现他原本能跑通的多文件重构任务开始报 context-overflow 错误。他挖进服务器下发的模型目录,发现 OpenAI 把 Codex 的原始上下文窗口从 372,000 tokens 缩减到 272,000 tokens——一夜之间削减 27%,没有任何公告、changelog 或文档更新。

这个问题作为 GitHub issue #32806 提交到 openai/codex 仓库,收到 36 个 thumbs-up 后被标记为"resolved"——不是因为 OpenAI 撤销了改动,而是被 bot 自动关闭为重复 issue。四天后,OpenAI 在 release notes 里悄悄塞了一行:"corrected their context windows to 272,000 tokens"。他们选的词是 "corrected"(修正),好像之前的 372K 是个错误。

一、表面与里子:广告容量与实际容量

数字本身就够刺眼。但更值得关注的,是 OpenAI 广告容量与 Codex 实际容量之间的鸿沟。GPT-5.6 Sol 模型官方页面列出的上下文窗口是 1,050,000 tokens。按同样的 95% 有效率,应该提供约 997,500 可用 token。Codex 现在只暴露 258,400——这是广告容量的 25.9%

更微妙的是定价细节。OpenAI API 定价页面规定,超过 272,000 input tokens 的请求按 2x 输入和 1.5x 输出计费。Codex 现在的原始窗口上限恰好卡在 272,000 tokens——用户即便愿意为长上下文付双倍价,也无法通过 Codex 访问公开的长上下文 tier。这个上限位置太精确,不像巧合。

Codex 上下文窗口变化(2026-07) 广告容量:1,050,000 tokens (GPT-5.6 Sol) 旧:372K (35.4%) 用户实际可用 新:272K (25.9%) "corrected" 后实际可用 广告容量与实际可用容量的鸿沟

图1:Codex 上下文窗口从广告容量到实际可用的衰减

二、真正的旋钮:juice 参数从 960 到 128

上下文缩减只是冰山一角。更关键的是 OpenAI 内部一个叫 "juice" 的推理算力预算参数——它决定了模型在 Max 档位下愿意"思考"多久。这个参数从上线初期的 960 被临时下调到 128,下降 87%

效果立竿见影:内部推理算力预算下降 87%,编程场景单轮 token 消耗降低 50% 以上,全场景平均任务耗时缩短 61%。对日常任务——写普通代码、做 PPT、整理信息——用户感觉"速度明显变快"。但需要深度推理的复杂任务,"先研究、再动手、边做边自我推翻"的劲头消失了。

一个日本市场调研团队形容:此前他们的自研 CLI 工具稳定交付远超预期的结果,要求 10 分给 12 分、13 分;但那天早上,它只剩 8 分了。

三、成本仅为对手 1/4:商业逻辑的胜利

为什么 OpenAI 要干这件"自降武功"的事?答案藏在商业逻辑里。2026 年 7 月,OpenAI 与 Anthropic 正围绕编程开发者市场展开激烈的额度补贴战。OpenAI 要实现反超,就必须让用户"免费"畅快地用。但未压缩的 Sol 算力消耗极高,大规模发放免费额度无异于烧钱。

这次优化直接让成本降到了"可以打价格战"的水平。数据显示,GPT-5.6 Sol 在中等强度任务下的推理成本,仅为 Anthropic Claude Fable 5 的 1/4。OpenAI 用"深度换广度"——单用户深度降低,但能服务 4 倍用户,并支撑补贴战。

四、开发者的撕裂反馈

Hacker News 上的讨论呈现明显的两极分化。一边是依赖长上下文做大型代码库探索的开发者:"The lack of long context is the main reason that I still end up using Anthropic." 另一边是专注型工作流的开发者:"I had a /goal running last night for 9.5 hours straight while I slept. When I woke up it was fully on task and focused."

核心分歧在于工作流:专注、计划良好的工作可以用 272K + compaction 应付;探索性、大型陌生代码库的工作需要每一个 token。OpenAI 的选择很明确——服务前者(更大众的市场),牺牲后者(更小众的高端需求)。

关联推荐

---

评论 (0)

加载评论中…

OpenAI 静默缩减 Codex 上下文:372K 到 272K 的成本权衡 | 必学必会