#CrowdStrike #Falcon传感器 #7·19全球宕机 #Channel File 291 #内核级单点故障
CrowdStrike一次更新弄瘫全球850万台电脑,54亿美元损失不是黑客干的
史上最贵的一次蓝屏
2024年7月19日UTC时间凌晨一点半,全球的电脑开始同时蓝屏
达美航空一家就取消了近7000个航班,英国医院推迟手术、救护车改道,澳大利亚的电视信号黑成一片,美国银行柜台退回纸笔办公,这不是什么精妙的黑客攻击,而是一家叫CrowdStrike的网络安全公司发出的一次例行内容更新,一个编号291的内容文件,三十分钟击穿了全球近半Windows机器
仅财富500强企业的损失估计就超过54亿美元
更荒诞的是肇事者的身份,CrowdStrike的本职工作是保护客户不被黑客攻破,它的口号叫stopping the breach,而那天它自己成了历史上最大的一次breach,这是我见过的网络安全行业十年来最戏剧性的一幕
本该保护全世界不蓝屏的公司,自己蓝屏了全世界
它曾是英雄,然后才是罪魁
要搞懂这次蓝屏,得先看它是怎么登上神坛的
CrowdStrike成立于2011年,CEO George Kurtz出身McAfee,在全行业还在卖笨重的本地杀毒软件时,它把端点防护搬上了云,Falcon代理又轻又快,威胁一露头全网皆知,这套打法像把整座城市的保安换成了神经感知网络,资本为这个故事疯狂,2019年上市时股价34美元,之后一路涨到397美元,市值一度逼近千亿美元
它也确实配得上这份追捧,民主党全国委员会邮件门事件的溯源,好几起勒索软件团伙的覆灭,背后都有它的身影,在企业客户眼里Falcon不是开支,是保命符,财富500强里大半公司都在用它的服务
那是它的高光时刻,也是炸药码放整齐的时刻
一个文件为什么能击沉全世界
问题来了,一家安全公司怎么能犯这么低级的错
我一开始以为是哪个员工没做测试就手滑点了发布,读完那份根因分析报告才改掉这个想法,内容验证器自己带着bug,负责拦截问题内容的守门员因为自身故障把这份内容放行了,这等于请了一位色盲校对员来检查红头文件,问题内容不是溜进来的,是大摇大摆走进来的
更深的原因藏在产品形态里,为了更快更准地抓病毒,Falcon运行在Windows内核层,内核权限就像让保安住进你家主卧,他反应最快,可他一旦精神失常,你全家都被锁在门外,7月19日那天,失常的保安拖着850万台机器一起进了重启死循环
你会发现一个很奇怪的地方,CrowdStrike恰恰是因为太优秀才出的事,因为检测快,更新就要快,因为客户信任,默认全量推送,因为市占率高,一个文件就能覆盖全球,炸掉世界的不是疏忽,是效率本身
股价腰斩,与客户的不离开
市场的反应又快又狠,股价从397美元一路砸到200美元,几周时间腰斩
Kurtz的应对堪称教科书,公开道歉,上所有主流电视台,去国会作证,给中小客户送服务抵扣,把更新机制改成分批灰度,拉着微软一起建立联合审查,一整套动作干净利落,没有一个拖泥带水的环节
但真正救它命的不是公关,是客户走不了,换一家端点安全厂商等于在手术中途换主刀医生,没有哪个CISO敢冒这个险,出事那个季度它的收入增长曲线甚至没有抖一下,锁住客户的不是信任,是切换成本,这是to-B生意最现实的一层
一年后股价爬回历史高位附近,仿佛什么都没发生过
谁来监督监督者
故事到这里似乎是圆满结局,可我始终过不去一个问题
我们不会让一家电梯公司控制全世界所有的电梯,不会让一家电池厂给所有飞机供电,却放任一个安全代理跑在数百万台企业机器的内核层,更新内容全球同步,没有二次确认,7·19不是CrowdStrike一家的意外,是整个行业单一栽培模式迟早要付的账单
这件事意味着什么,意味着安全公司越成功就越危险,它覆盖得越深,就越像公共事业,而公共事业不该被允许在凌晨一点一键向全球推送更新,信任越深,越应该被关进笼子
下一次蓝屏只是时间问题,我们能赌的只有它别亮在自己屏幕上,但运气从来不是可靠的安全方案
资料来源:CrowdStrike官方根因分析报告、美国国会听证记录、Parametrix损失评估及公开市场信息整理

