文章回顾2025年AWS大规模中断,强调单一云脆弱性。多云虽好但复杂,Kubernetes作为抽象层提供真正的可移植性和弹性,并提升开发者生产力。
译自:The Great AWS Outage: The $11 Billion Argument for Kubernetes[1]
作者:Arjun Iyer
嗯,那真是糟糕的一周。
如果你在科技行业,你肯定知道我说的是哪一周。那是2025年10月声势浩大的AWS[2]us-east-1 大规模中断。当警报开始响起时,你在哪里?
我正在进行演示,突然,一切都停止工作了。我们的应用程序、我们的认证、我们的 CI/CD 流水线,全都失效了。那是一个数字鬼城。八个小时里,互联网的很大一部分——从流媒体服务和电子商务网站,到令人恐惧的金融和医疗保健平台——就这么凭空消失了。
随后的几天和几周里,事后分析报告纷纷出炉。Tom’s Guide[3]等出版物记录了这次巨大的、连锁性的影响,而福布斯[4]则一直在统计损失。目前的估计是多少?超过110亿美元的收入损失和市值蒸发。
一百一十亿。美元。
跟风指责 AWS 很容易。但老实说,在这种规模下进行工程设计是极其困难的。故障总会发生。
现在尘埃落定,我们需要问自己一个真正令人不安的问题:我们为何如此脆弱?
单一云的诱惑
十年来,公共云一直是一个令人难以置信的加速器。我们用资本支出换取了运营支出,作为回报,我们获得了按需计算、存储以及丰富的托管服务生态系统。这是一笔划算的交易。
但我们也变得安逸了。我们围绕一个提供商的专有 API 构建了我们的整个系统和业务。我们基于 DynamoDB 构建,使用 Lambda 作为函数,并通过身份和访问管理 (IAM) 将一切连接起来。它速度快,功能强大,但也像一颗定时炸弹。
十月的大规模中断不仅仅是一次服务故障;它是控制平面的故障。当身份服务崩溃时,整个纸牌屋都倒塌了。它暴露了我们思维中的根本缺陷:我们在一个单一的、巨大的故障点之上构建了极其弹性的应用程序。
福布斯文章指出,华尔街现在最喜欢用的词是“多云”。他们没错。例如,那些在 AWS 和 Google Cloud Platform (GCP) 上拥有 active-active 设置的公司,当时发推文说的是“我们正在经历一些小问题”,而不是“我们彻底瘫痪了”。
但对我们大多数人来说,“直接上多云”是一个糟糕、简单且极其昂贵的建议。