亚马逊云科技无法恢复仅存储在受损的中东可用区的数据
点击查看原文>
亚马逊云科技已经告知客户,无法恢复仅存储在中东部分区域内的数据。在本周关于中东(阿联酋)me-central-1和中东(巴林)me-south-1的状况更新中,该公司表示,巴林地区的受损程度超出了其区域性多可用区服务的设计承受能力。
关于阿联酋区域,亚马逊云科技写道:
经过全面评估,我们确定无法恢复对仅托管在 mec1-az2 可用区中的资源和数据的访问。我们正在继续努力恢复区域资源,以及托管在其他受影响可用区(mec1-az1 和 mec1-az3)中的可用区资源。
对于巴林,这次评估涵盖了整个区域:
我们基础设施遭受的破坏波及多个可用区,而且超出了我们区域性多可用区服务的设计承受能力。经过全面评估,我们确定无法恢复对仅托管于该区域的资源和数据的访问。
InfoQ 3 月份报道称,无人机袭击导致分布于这两个区域的三个亚马逊云科技数据中心受损,其中阿联酋的三个可用区中有两个受到了严重的影响,巴林的一个基础设施也遭到袭击。当时,亚马逊云科技建议客户将关键数据复制到其他区域,不久后又建议将工作负载完全迁出中东地区。
亚马逊云科技表示,他们正在更换受影响的基础设施,并且已经通知相关主管部门,将在未来数月内更新服务恢复进展,而关于巴林地区的更多细节将于 2027 年初公布。该公司于 2019 年开通了巴林区域,2022 年开通了阿联酋区域。
Hacker News 上的社区讨论,更多集中在客户对所购买服务的理解上,而不是这些袭击事件。
很快,一段 2025 年对亚马逊云科技高管的电视采访视频被翻了出来。当被问及如果有人发现一个未标记的 AWS 数据中心并将其摧毁会发生什么,以及系统是否具备足够的冗余性以确保客户不会察觉时,她回答道:
是的,你们不会察觉的。我的意思是,我们可能会有点不高兴,但你们不会察觉的!
评论者 krick 描述了这种表态给客户带来的处境:
这类说法相当常见,听起来合情合理,理应属实,所以尽管我并不十分了解亚马逊云科技冗余规划的具体细节,但我过去一直信任他们。当他们断言“没问题”,结果一周后却发现并非如此时,这真的令人担忧。
评论者 houssc 补充了缺失的限定条件:
需要注意的是,这始终是“在你正确使用该服务”的前提下,而正确使用可不一定意味着免费。这意味着要充分利用多个地理区域,在你的技术栈中构建冗余机制,诸如此类。
评论者 jacquesm 进一步指出他最常看到的误解:团队认为只要使用了亚马逊云科技的云服务就是对的:
他们没有意识到,AWS 只是一个工具箱,而不是“针对你可能面临的所有灾难而预先准备好的冗余解决方案”。
相关文档印证了这一解读。S3 Standard 及其相关存储类服务会在一个区域内的至少三个可用区内冗余地存储对象,而且亚马逊云科技声明,其年数据持久性达 99.999999999%。这两点均属于区域级特性。评论者援引了亚马逊云科技的灾难恢复指南,其中显示,该公司长期以来一直建议客户将备份复制到另一个区域,其中包括这样一句说明:所有灾难恢复策略都要求先在区域内备份数据源,然后将其复制到恢复区域。
讨论的分歧点在于“谁应该知道”这一点。评论者 albert_e 认为,该知识并非隐蔽信息,因为即使是最基础的 AWS 认证课程,也会讲授“共同责任模型”以及客户的义务从何处开始。
还有人认为,这种负面观感应归咎于供应商。评论者 mhitza 指出,云服务提供商是通过营销和会议渠道向企业高管们灌输这一理念的,就像过去两年间人工智能的相关论述如何传入了企业高管们的耳朵中。评论者 lelanthran 则将这一观点转化了为一个现实问题:
CEO 会相信谁?是亚马逊、微软以及整个 IT 基础设施部门,还是那个与他们持不同意见的孤军奋战的 SRE?
评论者 dijit 给出了一个结构性的解释。分布式存储是在性能与正确性之间进行权衡,而外包则意味着由他人来进行这种权衡,而且权衡的侧重点会倾向于客户能察觉到的方面:
你不会注意到还有一台位于异地的第三提交服务器(除非该站点遭到轰炸),但你会注意到写入速度变慢了。
最尖锐的讨论集中在那些无法在其他地方进行数据复制的客户身上。亚马逊云科技表示,无法恢复的数据完全托管在受影响的可用区和区域内,有评论者将这一表述与要求信息必须保留在国家边界内的数据驻留义务联系起来。将加密备份发送至国外显然无法解决这个问题,因为解密密钥也需要位于管辖范围之外,才能在区域性数据丢失后发挥作用。
这种矛盾在 3 月份就已经显露无遗。T-Systems International 的一位高级云架构师当时警告称,虽然在危机期间迁移工作负载可能恢复服务,但会将敏感数据推向国境之外,并且数据驻留是一项法律要求,而非最佳实践。
《企业集成模式》(Enterprise Integration Patterns)一书的合著者 Gregor Hohpe 在今年 3 月指出,这种风险是地理性的,而非合同性的:
风险是区域性的,与特定服务提供商无关。那些攻击了 ME-CENTRAL 的人,同样可以轻松地攻击 Azure 或任何其他数据中心。
六个月后,这种论述已经产生了具体的效果。多可用区(Multi-AZ)架构将工作负载分布在彼此相距约 100 公里的多个设施中,这可以防范亚马逊云科技列出的各种故障模式,包括停电、雷击、龙卷风和地震。但它无法防范能在同一晚上同时袭击其中多个设施的攻击者。
接下来要讨论的问题比多区域策略的范围要窄。亚马逊云科技的表述是,无法恢复的数据完全托管在受影响的区域和可用区内。因此,对任何团队而言,实际的检验标准在于:目前是否有任何数据仅存于一个区域且在其他地方没有副本,以及监管或合同义务是否允许副本离开该管辖区。如果不符合上述条件,则剩余的风险并非架构漏洞,而是对架构的限制,应列入风险登记册而非运行手册。
亚马逊云科技表示,他们仍然致力于为阿联酋和巴林的客户提供支持。需要协助的客户请联系亚马逊云科技的支持团队。
原文链接:https://www.infoq.com/news/2026/09/aws-middle-east-data-loss/
本文来源:InfoQ