点击蓝字关注我们

当时雨生就想到了此视频
雨生 2周前国内 云科技圈首发微软全球蓝屏新闻,总体阅读量过万,
以下是相关链接
恰好FT财经最近报道了此事,那么今天雨生就和大家一起复盘下
1. 2024年7月19日,由CrowdStrike(美国数字安全供应商)的一次有问题的软件更新导致8.5百万台Microsoft Windows设备受到影响。这导致航班停飞、医院预约推迟、新闻广播中断等问题。

2. 这次事件暴露了全球数字化和互联经济中的脆弱性,特别是软硬件集中在少数供应商手中的问题,包括云计算三巨头之一Azure。
3. 雨生强调了建立可靠性工程SRE的重要性,尤其是跨供应商的多云IT基础设施

包括:
- 企业和政府需要了解自己的风险暴露,包括IT供应链【管理安全】 - 建立冗余和应急计划 - 多样化IT基础设施【比如多云】,使用多个网络安全、操作系统或云服务提供商 - 采用"空气隔离"等策略 - 分阶段推出更新
4. 公共和私营部门之间需要更紧密的合作,包括共享关于漏洞、压力测试等信息。
雨生点评:这回导致 主权云会进一步流行。
详情参考
5. 雨生指出,虽然建立多云SRE系统会有成本,但可以防范更昂贵的威胁。
雨生使用丰田的"五个为什么"方法来分析全球IT宕机事件:
1. 为什么会发生全球IT宕机? 因为CrowdStrike的一次软件更新导致了8.5百万台Microsoft Windows设备出现故障。
2. 为什么一次软件更新会导致如此广泛的故障? 因为这次更新包含了一个严重的bug,影响了核心系统功能。
3. 为什么这个严重的bug没有在发布前被发现? 因为测试流程可能不够全面,没有覆盖所有可能的使用场景或系统配置。
4. 为什么测试流程不够全面? 因为可能存在时间压力,或者对潜在风险的评估不足,导致简化了测试过程。
5. 为什么会存在时间压力或风险评估不足? 因为可能缺乏对软件更新潜在影响的充分认识,或者公司文化可能过于强调速度而忽视了安全性。通过这五个层层深入的问题,我们可以看到:
1. 直接原因:软件更新中的bug 2. 技术原因:测试流程不完善 3. 流程原因:风险评估不足 4. 管理原因:可能存在不当的时间压力 5. 文化原因:可能过于强调速度而忽视安全性

草台班子是经不起丰田的五个为什么的? 如果经得起那就再来5个为什么?


名词解释:

关于SPOF(Single Point of Failure,单点故障):
SPOF是指系统中的一个组件,如果它失效,会导致整个系统瘫痪。在IT系统中,这可能是一个关键服务器、网络连接或软件组件。减少SPOF是提高系统可靠性的关键。
SRE(Site Reliability Engineering,网站可靠性工程):

SRE是由Google提出的一种IT运维方法,旨在创建可扩展和高度可靠的软件系统。SRE工程师结合软件工程和系统管理的技能,

通过自动化和系统设计来提高系统的可靠性和效率。
SRE实践包括设定服务水平目标、错误预算管理、持续监控和自动化运维等。
这次全球IT宕机事件凸显了SPOF的危险性,也体现了SRE在预防和快速恢复此类事件中的重要性。
关于SRE 衍生阅读 请参考
《Google SRE工作手册》多云环境下SRE工程的思考(视频+文字版)

对雨生的文章感兴趣吗?

