点击蓝字关注我们
对雨生的文章感兴趣吗?
可以入群了解
标题: 谷歌云德国 法兰克福🇩🇪地区遭遇12小时断电,服务中断影响广泛
正文:
谷歌云于周四(10月24日)就其位于德国法兰克福的europe-west3地区长达12小时的服务中断事件向用户致歉。
事件详情:
1. 断电时间: 从10月24日当地时间02:30开始,持续到15:09,总计12小时39分钟。
2. 故障原因: 谷歌确认是由于电力故障和冷却系统问题,导致该地区三个可用区之一(europe-west3-c)的部分设备断电。
3. 影响范围: 虽然主要影响集中在单个可用区,但其他两个可用区也有不到1%的实例和磁盘资源操作出现内部错误。部分区域级服务也受到影响。
4. 受影响服务: 包括Cloud Build、Cloud Developer Tools、Cloud Machine Learning、Google Cloud Dataflow、Google Cloud Dataproc、Google Cloud Pub/Sub、Google Compute Engine、Google Kubernetes Engine、Persistent Disk和Vertex AI Batch Prediction等多项服务。
5. 具体影响:
- Compute Engine: 虚拟机创建失败,删除操作延迟,部分实例无法操作。
- Kubernetes Engine: 受影响区域的节点无法访问,新节点创建可能失败。
- Persistent Disk: 实例无法访问,阻碍相关操作。
- 其他服务如Dataflow、Dataproc和Cloud Build也出现不同程度的问题。
6. 谷歌响应: 在故障开始26分钟后首次通知用户,但直到近3小时后才提供临时解决方案。建议用户将工作负载迁移到其他地区或可用区,并对受影响的区域持久磁盘进行定期快照。
7. 历史背景: 虽然europe-west-3地区不常发生故障,但去年曾出现过影响云工作站的事件。今年5月,谷歌云还曾因维护操作失误导致33项服务中断近3小时。
此次事件再次凸显了云服务提供商在保障服务可靠性和快速响应故障方面面临的挑战,也提醒企业用户需要制定完善的灾难恢复和业务连续性计划。



