大数跨境

全球IT宕机的教训-企业和政府需要缓解单点故障

全球IT宕机的教训-企业和政府需要缓解单点故障 雨神汇
2024-08-12
0
导读:雨生告诉你云计算的真相

点击蓝字关注我们


当时雨生就想到了此视频


雨生 2周前国内 云科技圈首发微软全球蓝屏新闻,总体阅读量过万,

以下是相关链接

31/7微软股票急跌15%,今天宕机蓝屏已经超10小时

Happy Blue Friday@ 七月的第三个星期五

Blue Friday告别高速增长的996时代

草台班子

全球windows宕机的头条

美国飞机要全部停航么?

微软全球宕机了么?


恰好FT财经最近报道了此事,那么今天雨生就和大家一起复盘下


1. 2024年7月19日,由CrowdStrike(美国数字安全供应商)的一次有问题的软件更新导致8.5百万台Microsoft Windows设备受到影响。这导致航班停飞、医院预约推迟、新闻广播中断等问题。


2. 这次事件暴露了全球数字化和互联经济中的脆弱性,特别是软硬件集中在少数供应商手中的问题,包括云计算三巨头之一Azure。


3. 雨生强调了建立可靠性工程SRE的重要性,尤其是跨供应商的多云IT基础设施


包括:

  - 企业和政府需要了解自己的风险暴露,包括IT供应链【管理安全】   - 建立冗余和应急计划   - 多样化IT基础设施【比如多云】,使用多个网络安全、操作系统或云服务提供商   - 采用"空气隔离"等策略   - 分阶段推出更新

4. 公共和私营部门之间需要更紧密的合作,包括共享关于漏洞、压力测试等信息。

雨生点评:这回导致 主权云会进一步流行。

详情参考

特朗普遇刺事件会加速主权云/AI普及



5. 雨生指出,虽然建立多云SRE系统会有成本,但可以防范更昂贵的威胁。



雨生使用丰田的"五个为什么"方法来分析全球IT宕机事件:


1. 为什么会发生全球IT宕机?  因为CrowdStrike的一次软件更新导致了8.5百万台Microsoft Windows设备出现故障。


2. 为什么一次软件更新会导致如此广泛的故障?  因为这次更新包含了一个严重的bug,影响了核心系统功能。


3. 为什么这个严重的bug没有在发布前被发现?  因为测试流程可能不够全面,没有覆盖所有可能的使用场景或系统配置。


4. 为什么测试流程不够全面?  因为可能存在时间压力,或者对潜在风险的评估不足,导致简化了测试过程。


5. 为什么会存在时间压力或风险评估不足?  因为可能缺乏对软件更新潜在影响的充分认识,或者公司文化可能过于强调速度而忽视了安全性。通过这五个层层深入的问题,我们可以看到:


1. 直接原因:软件更新中的bug 2. 技术原因:测试流程不完善 3. 流程原因:风险评估不足 4. 管理原因:可能存在不当的时间压力 5. 文化原因:可能过于强调速度而忽视安全性

草台班子是经不起丰田的五个为什么的? 如果经得起那就再来5个为什么?



名词解释:

关于SPOF(Single Point of Failure,单点故障):


SPOF是指系统中的一个组件,如果它失效,会导致整个系统瘫痪。在IT系统中,这可能是一个关键服务器、网络连接或软件组件。减少SPOF是提高系统可靠性的关键。


SRE(Site Reliability Engineering,网站可靠性工程):

SRE是由Google提出的一种IT运维方法,旨在创建可扩展和高度可靠的软件系统。SRE工程师结合软件工程和系统管理的技能,


通过自动化和系统设计来提高系统的可靠性和效率。

SRE实践包括设定服务水平目标、错误预算管理、持续监控和自动化运维等。



这次全球IT宕机事件凸显了SPOF的危险性,也体现了SRE在预防和快速恢复此类事件中的重要性。


关于SRE 衍生阅读 请参考

《Google SRE工作手册》多云环境下SRE工程的思考(视频+文字版)


对雨生的文章感兴趣吗?


 



雨生云计算

微信号:FinOpsCFM
点击蓝字关注我们



【声明】内容源于网络
0
0
雨神汇
1234
内容 0
粉丝 0
雨神汇 1234
总阅读0
粉丝0
内容0