其实11.12日 那次阿里云AK故障当时雨生写了一半的文章,考虑到影响就暂时没自己写专栏,而转载了几篇圈内朋友的文章

可没想到今天,11.27日,尊敬的客户:
您好!北京时间2023年11月27日 09:16起,阿里云监控发现中国大陆地区(北京、上海、杭州、深圳、青岛 )、中国香港以及美东、美西地域的数据库产品(RDS、PolarDB、Redis等)的控制台和OpenAPI的访问出现异常,实例运行不受影响。经过工程师紧急处理中,访问异常问题已于当日10:58恢复。非常抱歉给您的使用带来不便,若有任何问题,请随时联系我们。
雨生点开https://status.aliyun.com/#/ 没看到故障,
刷新了下果然更新了

鉴于去年雨生写的文章原厂根本没人搭理
十六问阿里云?这事谁管?惊!早分家了, 阿里云HK的PCCW把机房卖DigitalBridge,运维卖联想!
今年就简单些吧:

几句话
AK老师说“这个openapi的可用性堪比openai了”
雨生自己说“这个OpenAPI的可用性和OpenAI 就差一个P字了


求各厂商以后出大事故最好不要Q4。太影响客户绩效了。实在不行非要出就Q1。
行不行?
雨生按:

SRE多云 论证和建设 势在必行啊,单一云 甚至 单一云多可用区在国内云计算公司算是幻灭了。不要把他等同于 AWS 的 多Az,和谷歌的GSLB
SRE(Site Reliability Engineering,站点可靠性工程)是一种工程学方法,旨在创建和运行可靠的、大规模的软件系统。
SRE 团队通常负责确保系统的可用性、性能、效率,以及推动系统的改进,使其能够承受各种形式的压力和负载。在多云管理的环境中,SRE 工程师面临着在多个云服务提供商(如 AWS、Google Cloud、Azure 等)之间分配和管理资源的任务。这种环境增加了系统的复杂性,因为每个云提供商都可能有自己独特的APIs、服务、管理工具和最佳实践。
熵增(Entropy Increase)在物理学中描述的是一个系统从有序状态向无序状态的转变。在多云管理的情况下,熵增可以用来比喻管理复杂性和混乱度的增加。
以下是几个导致熵增的因素:
1. **配置管理的复杂性**:在多云环境中,配置管理变得更加复杂,因为每个云平台可能需要不同的配置和管理方式。这可能导致配置错误和一致性问题。
2. **服务互操作性**:不同云服务之间的互操作性问题可能导致数据和服务集成的复杂性增加。
3. **网络复杂性**:在多云环境中,网络配置(如VPC、子网、VPN等)变得更加复杂,这可能导致网络性能问题和安全风险。
4. **数据管理**:在多个云平台上管理数据需要确保数据一致性、复制和备份,这增加了数据管理的复杂性。
5. **安全和合规性**:不同云平台可能有不同的安全要求和合规标准,管理多云环境需要确保所有平台都符合安全最佳实践和法规要求。
6. **成本管理**:在多云环境中,成本管理变得更加复杂,需要精确跟踪和优化跨多个平台的资源使用和费用。
为了应对这些挑战,SRE 团队需要采取一系列措施来降低熵增,
包括:- **自动化**:自动化部署、配置管理和监控可以帮助减少人为错误和操作的复杂性。
- **标准化**:制定跨云平台的标准化操作流程和工具集,以便统一管理方法。
- **监控和日志记录**:实施全面的监控和日志记录策略,以便跟踪和分析跨多个云平台的系统性能和安全事件。
- **灾难恢复和备份**:制定灾难恢复计划和备份策略,以确保数据的持久性和可恢复性。
- **成本优化**:使用成本管理工具和策略来监控和优化资源使用,以减少不必要的开支。
- **培训和知识共享**:对团队进行多云环境管理的培训,并鼓励知识共享,以提高整个团队对多云环境的理解和管理能力。
通过这些方法,SRE 团队可以有效地管理多云环境的复杂性,确保系统的可靠性和效率,从而降低熵增。
《Google SRE工作手册》多云环境下SRE工程的思考(视频+文字版)
最后To 云厂商,你们搞出这么多熵增 是要毁灭地球?还是要让客户秃头


