Facebook 服务器瘫痪事件回顾
Facebook 作为国际顶尖的媒体平台,市值曾高达 9000 多亿美元。然而,近期该网站遭遇了令人震惊的重大事故:服务器全面瘫痪长达 6 小时,所有应用无法使用。对于如此体量的巨头而言,即便出现故障通常也能迅速启动应急措施,但此次 Facebook 却因一连串巧合陷入了极度被动的局面。
事故起因是一名负责维护的程序员误输入了命令。正常情况下,系统审计工具应拦截此类错误指令,但由于审计工具自身存在 Bug,导致错误命令被执行。更糟糕的是,由于数据中心安全设计过于严格,工程师无法及时接触到服务器进行修复,致使故障持续恶化。甚至在首次尝试修复并重新上线后,Facebook 再次崩溃,直到 6 小时后才彻底恢复。这一系列波折直接导致了 Facebook 市值的大幅缩水。
事件经过详解:
10 月份,Facebook 在进行网络状态评估时,工程师操作失误,将命令错输为“清空路由”。本应被拦截的错误指令,因审计工具 Bug 而被执行,导致所有域名服务器无法连接至 IP,自有域名服务器全面瘫痪。由于缺乏正常的 DNS 解析,业务被迫中断。此外,事故发生后,原本可快速修复的问题,却因数据中心过度的安全机制阻碍了工程师接触服务器,严重延误了抢修时间。
此次宕机事故发生后,Facebook 股价暴跌 6%,创始人扎克伯格的个人财富在一天之内蒸发超过 60 亿美元。

