OpenAI 静默缩减 Codex 上下文:372K 到 272K 的成本权衡

OpenAI 在 2026 年 7 月将 Codex 上下文窗口从 372K 静默缩减到 272K tokens(27% 削减),未提前公告。配合内部推理算力参数 "juice" 从 960 降到 128,编程场景单轮 token 消耗降低 50%+。这是 OpenAI 在 Codex 流量翻倍压力下"优先保用户数而非单用户深度"的工程选择。
2026 年 7 月 13 日,一位 Codex 用户发现他原本能跑通的多文件重构任务开始报 context-overflow 错误。他挖进服务器下发的模型目录,发现 OpenAI 把 Codex 的原始上下文窗口从 372,000 tokens 缩减到 272,000 tokens——一夜之间削减 27%,没有任何公告、changelog 或文档更新。
这个问题作为 GitHub issue #32806 提交到 openai/codex 仓库,收到 36 个 thumbs-up 后被标记为"resolved"——不是因为 OpenAI 撤销了改动,而是被 bot 自动关闭为重复 issue。四天后,OpenAI 在 release notes 里悄悄塞了一行:"corrected their context windows to 272,000 tokens"。他们选的词是 "corrected"(修正),好像之前的 372K 是个错误。
一、表面与里子:广告容量与实际容量
数字本身就够刺眼。但更值得关注的,是 OpenAI 广告容量与 Codex 实际容量之间的鸿沟。GPT-5.6 Sol 模型官方页面列出的上下文窗口是 1,050,000 tokens。按同样的 95% 有效率,应该提供约 997,500 可用 token。Codex 现在只暴露 258,400——这是广告容量的 25.9%。
更微妙的是定价细节。OpenAI API 定价页面规定,超过 272,000 input tokens 的请求按 2x 输入和 1.5x 输出计费。Codex 现在的原始窗口上限恰好卡在 272,000 tokens——用户即便愿意为长上下文付双倍价,也无法通过 Codex 访问公开的长上下文 tier。这个上限位置太精确,不像巧合。
图1:Codex 上下文窗口从广告容量到实际可用的衰减
二、真正的旋钮:juice 参数从 960 到 128
上下文缩减只是冰山一角。更关键的是 OpenAI 内部一个叫 "juice" 的推理算力预算参数——它决定了模型在 Max 档位下愿意"思考"多久。这个参数从上线初期的 960 被临时下调到 128,下降 87%。
效果立竿见影:内部推理算力预算下降 87%,编程场景单轮 token 消耗降低 50% 以上,全场景平均任务耗时缩短 61%。对日常任务——写普通代码、做 PPT、整理信息——用户感觉"速度明显变快"。但需要深度推理的复杂任务,"先研究、再动手、边做边自我推翻"的劲头消失了。
一个日本市场调研团队形容:此前他们的自研 CLI 工具稳定交付远超预期的结果,要求 10 分给 12 分、13 分;但那天早上,它只剩 8 分了。
三、成本仅为对手 1/4:商业逻辑的胜利
为什么 OpenAI 要干这件"自降武功"的事?答案藏在商业逻辑里。2026 年 7 月,OpenAI 与 Anthropic 正围绕编程开发者市场展开激烈的额度补贴战。OpenAI 要实现反超,就必须让用户"免费"畅快地用。但未压缩的 Sol 算力消耗极高,大规模发放免费额度无异于烧钱。
这次优化直接让成本降到了"可以打价格战"的水平。数据显示,GPT-5.6 Sol 在中等强度任务下的推理成本,仅为 Anthropic Claude Fable 5 的 1/4。OpenAI 用"深度换广度"——单用户深度降低,但能服务 4 倍用户,并支撑补贴战。
四、开发者的撕裂反馈
Hacker News 上的讨论呈现明显的两极分化。一边是依赖长上下文做大型代码库探索的开发者:"The lack of long context is the main reason that I still end up using Anthropic." 另一边是专注型工作流的开发者:"I had a /goal running last night for 9.5 hours straight while I slept. When I woke up it was fully on task and focused."
核心分歧在于工作流:专注、计划良好的工作可以用 272K + compaction 应付;探索性、大型陌生代码库的工作需要每一个 token。OpenAI 的选择很明确——服务前者(更大众的市场),牺牲后者(更小众的高端需求)。
关联推荐
- Codex 加密子代理提示:AI 编程安全的新博弈 — Codex 的另一面:安全机制演进
- DSL让LLM更可靠:Martin Fowler 详解领域特定语言的约束力量 — 用约束换可靠性的另一条路径
- The Tower Keeps Rising:AI编程时代的巴别塔寓言 — AI 编程工具竞争的宏观视角
评论 (0)
加载评论中…