7月25日傍晚,OpenAI官方状态页挂出“Investigating”预警。API、ChatGPT、Codex三条核心产品线同时报错,涉及12个API组件、15个ChatGPT组件和4个Codex组件,合计31个服务组件性能下降。用户侧感受直接:请求失败、响应异常、任务中断。直到19时08分,服务全部恢复,整个过程持续了1小时51分钟。
这起事故本身不算罕见,真正让外界不安的是——OpenAI已经连续17天没有出现过完全正常的状态。第三方监测平台Bifrost的数据显示,从7月9日开始,OpenAI的服务就一直在“Degraded Performance”(性能下降)和“Partial Outage”(部分中断)之间摇摆,期间还夹杂了7月12日和16日的两次“Major Outage”(重大停摆)。另一个监测站incidenthub的记录同样触目惊心:仅7月23日一天,OpenAI就挂出了四起独立事故,24日Codex Review报错,25日轮到三线齐崩。
![]()
如果把视线拉回两年前,ChatGPT宕机主要冲击的是聊天体验。而这一次,故障的性质已经变了。API背后连接着客服机器人、代码流水线、自动化审计以及各类Agent工作流。服务中断111分钟,就等于生产线停了111分钟。尤其Codex中招格外扎眼——这是OpenAI的代码生成与执行环境,大量编程Agent依赖它运转。任务执行到一半被硬生生切断,轻则卡住几十分钟,重则让一个运行中的大项目直接烂尾。
官方状态页下方那句广告语成了当下市场情绪的注脚:“OpenAI挂了?自动把请求路由到健康的替代模型。”多模型容灾,已经从技术备选方案变成了一门实实在在的生意。对企业选型而言,这组连续17天的异常记录,会把一个指标推到台前:SLA。模型能力的排行榜周周有新面孔,但可靠性是按天计算的。能力差距也许只在几个百分点之间,而宕机带来的损失是100%。
故障原因目前官方保持沉默。合理推演指向两个方向:夏季推理负载持续爬坡,叠加新模型与新功能频繁发布,基础设施长期处于压线运行状态。不过这些都还是推测,市场等待的是官方复盘。但当“连续17天不正常”这个数字摆在那里,一句“错误率升高”显然不够,大家需要听到比这几个字复杂得多的解释。
这次事件还会加速两个变化。其一,多云多模型路由将从加分项变成企业AI架构的标配,单家依赖的风险敞口会被重新定价。其二,每一次海外旗舰服务出问题,都会给国产大模型带来承接溢出需求的机会——前提是,自家的稳定性先扛住同样陡峭的负载曲线。
Agent时代的宕机账单,算法已经不一样了。不再是用户干等回复,而是生产线停摆、任务搁浅、合同风险。对OpenAI而言,这17天不只是一次工程压力的集中释放,更是一场关于“可靠性溢价”的公开课。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.