![]()
![]()
2026年盛夏,全球开发者的心率,正在被一家叫OpenAI的公司按在地上摩擦。
7月,被官方誉为“碾压竞品Fable 5”的全新旗舰模型 GPT-5.6 Sol 轰然上线。
算力狂欢还没持续两天,硅谷到中关村的程序员们打开后台,集体倒吸一口凉气:
额度,空了
有人花大价钱顶格买的 Codex 20x 旗舰套餐,原本计划撑过一整个月,结果敲了36个小时代码,进度条直接见底;
更有硬核开发者拉出用量监控,赫然发现自己的账号在短短一天内被狂吞掉了 33亿(3.3 Billion)Token !
就在全网哀鸿遍野、骂声四起之际,推特(X)上一位老哥悄悄贴出了一张截图,随后引发了AI圈一场近乎狂欢的“地下大迁徙”。
他不仅没有多花一分钱,反而让顶配模型继续全速飞驰。
评论区瞬间炸锅,无数同行冲上来死死按住他的手: “求求你赶紧删除推文!别再炫了!OpenAI看到马上就要打补丁了!”
![]()
开发者 Eidzoku 晒出的监控日志:GPT-5.6 单日吞噬高达 33 亿 Token,请求量暴涨 6.26 倍
一夜烧穿33亿Token:GPT-5.6 到底在发什么疯?
要理解这场“大逃亡”,得先看清大家到底被逼到了什么绝境。
GPT-5.6 Sol 确实强得可怕
在各大编程基准测试中,它展现出了惊人的复杂逻辑推演与多步骤规划能力。
然而,强悍智商的背后,是一台 吃算力不吐骨头的超级粉碎机 。
资深开发者 Eidzoku 记录了一组触目惊心的数据:
6月23日(GPT-5.5 超高算力档):日消耗 3.27亿 Token;
7月2日(GPT-5.5 超高算力档):日消耗 5.49亿 Token;
7月20日(换上 GPT-5.6 Sol 高算力档):日消耗直接飙到了 33亿 Token !
为什么换了个新版本,食量暴涨了整整6倍?
深入日志底层后,开发者们抓到了一个令人哭笑不得的“系统Bug级行为”:
GPT-5.6 引入了全新的代码执行模式(Code Mode),理论上它应该能够把多个独立的工具调用(Tool Calls)打包在一起 并行处理 (比如前端常用的 Promise.all 机制)。
但实际跑起来,它几乎从来不打包!
在 739 次执行跟踪里,它只有可怜的 5 次启用了并行。
剩下的 734 次,它全都在 单线串行死磕 ,查一个文件、问一次模型;
改一行代码、再问一次模型
打个通俗的比方: 这就像你想从图书馆借10本书,原本可以拉个推车一次全搬走,现在的AI却选择叫了10趟专车,每趟车只放一本书,而且每次往返都要把之前聊过的整整几万字历史记录当成‘行李’死死拖在车尾。
结果就是:单次回答的字数并没有变长,但请求次数暴涨了 6.26倍 。
哪怕是 OpenAI 的 Codex 负责人 Tibo 都不得不亲自发文“灭火”,承认产品在用量指引和默认高算力设置上存在混乱,并紧急重置了一部分用户的额度。
但在物理算力上限面前,官方的缓冲不过是杯水车薪。 写代码写到一半被系统“拔管”,成了所有高强度开发者的日常噩梦。
绝境中的“邪修”:意外发现 OpenAI 的“阴阳账本”
当正规跑道被烧断,极客们的本能就是 找暗门 。
开发者 Iam_(@SPAC89)在 Codex 进度条彻底归零的那一刻,暂时没有掏信用卡额外充值。
他把视线挪向了屏幕另一侧那个平时只用来随口闲聊的 ChatGPT 对话框 。
他点开设置,做了一个极其简单的动作: 在 ChatGPT 网页端直接接入 GitHub 插件(Apps),把自己的私有代码仓库挂载进去。
![]()
开发者 Iam_(@SPAC89)晒出的实操截图:顶部挂载 GPT-5.6 Pro,直接在聊天流中调用代码工具接管项目
奇迹发生了
虽然右侧专门用来“干重活”的 Codex 代理额度已经彻底红牌罚下,但左侧挂着 GitHub 的 ChatGPT 网页对话框,却依然生龙活虎!
不仅响应速度飞快,而且调用的是性能顶格的 GPT-5.6 Pro 模型。
原来,OpenAI 在底层悄悄设置了两个互不通气的“记账本”:
- Codex / Work 代理账本
:专门针对自动化任务、终端执行和 IDE 联动,限制极严,五小时窗口和周额度稍不留神就会见底;
- ChatGPT 聊天账本
:针对日常交互对话,虽然也有防滥用机制,但容量池极其宽裕,在 Pro 订阅下几乎有着“无限续杯”的体感。
当你把 GitHub 授权给 ChatGPT 后,网页端聊天线程实际上是在云端的独立沙盒环境中运行。
它能看懂你的代码结构、能读你的完整项目、甚至能调用你存放在 GitHub 里的自定义技能(Skills) ,除了不能直接在本地终端替你敲回车,它的思考深度、上下文理解能力,与那个昂贵到让人肉疼的 Codex 毫无二致!
全网求停更:“闭嘴!再晒官方就要打补丁了!”
这篇推文配着一张布满代码工具调用痕迹的暗色截图,在 X 平台像野火一样蔓延。
不少评论立刻流露出由衷的“恐慌”
![]()
网友在评论区焦急留言:“求求你别秀了,官方要是打补丁我们就全完了”
资深开发者们在评论区急得跳脚:
“兄弟,收了神通吧!我的自动化机器人就是靠这个逻辑在跑的,OpenAI 一旦反应过来,我们全得被端!” “这是未公开的计量缝隙,大家悄悄用就好,别把它顶上热搜啊!”
中文技术圈更是给这套操作冠上了一个极其传神的名字, “邪修省 Token 大法” 。
事实上,这种现象并非孤例 开发者 Timothy Reavis 也在此前独立证实了这一机制:哪怕 Codex 的 20x 额度四天前就已彻底耗尽,只要通过 ChatGPT 的虚拟环境拉取仓库,依然可以在完全不增加任何成本的前提下,利用聊天池的独立限额继续推进复杂的工程任务。
![]()
开发者 Timothy Reavis 分享相同的独立发现:ChatGPT 拥有独立的用量窗口
从“投机取巧”到“工业分工”:90/10 黄金工作流
当狂欢与恐慌稍稍平息,工程师们开始冷静下来思考它的长期用法:
这条路径若能长期存在,我们究竟该怎么把它纳入工作流?
很快,以 JMT 为代表的一批架构师把这种野路子“邪修”,提炼成了一套正规军式的 工业级标准工作流,“90/10 黄金法则” :
![]()
JMT 建议将九成规划与架构工作放在连接 GitHub 的 ChatGPT 中,Codex 负责执行
阶段
角色与环境
消耗的资源池
核心任务
前 90% 思考 总架构师 / 军师
:ChatGPT Pro + GitHub 挂载
宽裕的 聊天配额
全库代码通读、架构设计、Bug 深度排查、实现方案推演、Diff 代码生成
后 10% 落地 施工队 / 泥瓦匠
:本地 Codex(Sol Medium 档)
昂贵的 代理配额
接收现成方案、在本地沙盒写入文件、运行测试套件、构建闭环验证
这套分工精准击中了当前大模型的物理软肋。
ChatGPT 挂载的 GitHub 插件虽然强大,但本质上是 偏只读(Read-Only) 的,它负责“深度思考”,帮你把所有的坑在云端算力里预先踩平,生成极度精确的修改步骤;
而 Codex 拥有极高的本地操作权限,但“思考成本”极其昂贵。 此时你直接把 ChatGPT 产出的成熟蓝图丢给它,让它只充当一个没有感情的“代码执行器”,几秒钟改完、跑测试、打完收工。
原作者 Iam_ 在实测一天后给出了令人震撼的战报: 采用这种“双轨制”分流之后,高昂的 Codex 额度消耗瞬间暴跌了 50% 以上!
以前一天烧光的配额,现在甚至能稳稳撑满一周。
算力通胀时代,我们正在成为“算力套利者”
把镜头从这场热闹的社区攻防战拉远,这起事件实际上揭开了 2026 年 AI 编程领域最隐秘、也最尖锐的商业矛盾:
模型的智商在呈指数级狂飙,但订阅制的商业模式正在被算力消耗逼入死角。
过去,我们把大模型当成“打字机”,按次提问,按字付费;
而现在,当 GPT-5.6 这类模型跨入 Agent(自主智能体) 时代,AI 每前进一步,背后都是几十次自发的循环推演、工具试错和上下文重载。
对于 OpenAI 这样的商业巨头而言,他们陷入了一场两难的走钢丝:
如果把额度定得太死,开发者干两小时就“断电”,产品体验瞬间崩塌;
如果全面放开无限使用,单日吞噬数十亿 Token 的重度用户,分分钟能把数据中心的电费账单烧穿。
这种商业模式上的割裂,最终在产品架构上撕开了一条缝隙, 为了保障日常交流的体验,OpenAI 必须在聊天侧保留一个宽大的“缓冲油箱”; 而为了防止算力被瞬间吸干,他们又不得不在代理执行侧套上沉重的“限流枷锁”。
开发者们所谓的“邪修”,本质上是一场聪明的 跨产品线算力套利 。
它标志着一个全新阶段的到来:在 2026 年,漂亮的 Prompt 只是程序员硬实力的一部分, 在复杂模型生态、不同计费账本和差异化工具链之间进行资源调度与架构解耦,同样考验全局视野。
只要这架轰鸣向前的 AI 飞机还在云端滑翔,只要算力的成本与人类野心的张力还在撕扯,这样的“备用跑道”与“民间智慧”,就永远不会消失。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.