亚马逊电子商务基础设施资深副总裁戴夫・崔德威尔(Dave Treadwell)在周二「TWiST」内部会议上,针对近期因软件代码部署引发的系统问题进行复盘。尽管官方澄清事故未涉及AI生成代码,但一周内四次最高级别故障暴露了电商核心系统在引入AI开发工具后的稳定性隐忧。
北美订单大规模流失:违规变更致防护网失效
3月上旬,亚马逊北美市场遭遇多次严重运营中断。3月2日,因系统显示错误送货时间导致购物车结算异常,引发160万次网站报错及近12万笔订单流失。3月5日灾情加剧,北美订单量瞬间暴跌99%,约630万笔订单在系统中“蒸发”,用户长达6小时无法结账、查看账户或商品价格。

内部文件指出,后续重大灾情的核心原因是一项未经正式文档记录与审核流程即上线的“生产环境变更”。该操作使单一工程师在缺乏自动化验证与安全防护的情况下,直接执行了高风险改动。虽然早期审查曾提及AI编程助手Q为诱因之一,但亚马逊随后删除相关描述并澄清,近期事件均未涉及AI撰写代码。
AI开发工具隐患浮现:代理性与决定性的冲突
此次事故并非孤例。2025年7月AWS推出AI编程工具Kiro后,同年12月即发生长期系统宕机致成本管理功能停摆。尽管官方归咎于人为失误,但AWS内部承认Vibe Coding模式过于复杂,难以追踪决策过程。
崔德威尔坦言,公司一周内发生4次“Sev 1”级事故。这反映出AI开发工具的根本缺陷在于“代理性”与“决定性”的冲突:AI模型输出具有不确定性,而电商核心系统要求绝对精准。微软等科技巨头同样面临类似挑战,凸显了在享受AI高效产出的同时,人类监督与完善防护机制不可或缺。
紧急整改:强制回归双人审核与安全重置
作为临时防护措施,亚马逊针对约335个由VP级管理的一级系统启动为期90天的安全重置计划。新规强制要求工程师在代码变更前回归传统“双人审核”机制,须经两人授权并详细记录;同时必须使用内部核准工具及合规的自动化代码系统。此外,所有高阶主管需全面稽核组织内的代码变更活动,以严格管控风险。

