OpenAI这次三线齐崩,闹得可不小。7月25日傍晚,API、ChatGPT、Codex三条产品线同时出问题,整整折腾了1小时51分钟才恢复。关键是,这已经不是偶发事件了——算下来,OpenAI已经连续17天没消停过。
到底崩成什么样?
北京时间7月25日17:17,官方状态页挂出“调查中”,说多项服务报错率飙升。到18:02进入监控阶段,说是缓解措施生效了,最后19:08宣布全面恢复。前后折腾了将近两个小时。
覆盖面有多广?API 12个组件、ChatGPT 15个组件、Codex 4个组件,合计31个服务都跟着掉链子。用户这边感受很直接——请求发不出去,响应半天不来,跑了一半的任务直接卡死。特别是Codex,编程Agent执行到一半卡住几十分钟,要是正在跑大项目,基本就烂尾了。
不是头一回,是连续17天
把时间拉长看,这事儿就没法当个例了。第三方监测平台Bifrost的记录显示,从7月9日开始,OpenAI没一天是完全正常的——7月12日和16日两次大范围宕机,其他日子不是在性能下降,就是在部分服务中断之间来回切换。另一个监测站incidenthub同样记录密集:光7月23日一天就挂了四起独立事故,24日Codex Review报错,25日就轮到三线齐崩。
官方还没给解释,但圈内推测无非两个方向:夏季推理负载持续爬坡,加上新模型新功能密集发布,基础设施长期处在压线跑的状态。
Agent时代,宕机性质不一样了
两年前ChatGPT崩了,最多是聊不了天。但现在是2026年,API背后连的是生产线——客服机器人、代码流水线、自动化审计、Agent工作流,哪个不是实打实的业务?断111分钟,就是生产线停111分钟。
有意思的是,监测页下面直接打了广告——“OpenAI挂了?自动把请求路由到健康的替代模型”。多模型容灾已经变成一门生意了。
对企业来说,这17天的记录把SLA(服务等级协议)推到了台前。模型能力榜每周都在变,但可靠性是按天算分的。能力差几个百分点还能忍,宕机损失可是100%实打实的。
往后看,两个趋势大概率会加速:一是多云多模型路由从加分项变成标配,单家依赖的风险得重新定价;二是每次海外旗舰一崩,都是国产模型接盘的机会——前提是国产的稳定性自己扛得住。
OpenAI工程团队应该很快会出复盘报告。但连续17天异常这个事实摆在那儿,市场要听的可不止“错误率升高”这五个字。
OpenAI的宕机,对于国产大模型来说,是一次机会!对于国内的AI硬件,包括:GPU、存储芯片等,会产生更大的需求!
上一篇:

