背景概述
根据 黄金形态通APP 报道,加密货币行业主要参与者 Coinbase 于 2026 年 6 月 1 日就 2026 年 5 月 7 日影响其服务的故障发布声明。声明指出,当晚 Coinbase 经历严重服务中断,交易、存款、取款及客户依赖的大部分界面不可用或降级约八小时,所有系统完全恢复又耗时十二小时。Coinbase 称中断时长不可接受,并向客户、合作伙伴及工程社区提供详细解释,说明事件经过、恢复耗时原因及改进韧性与基础设施的步骤。
关键要点
声明披露的核心事实包括:
- 美国东部时间 2026 年 5 月 7 日 19:20,AWS us-east-1 区域(可用区 use1-az4)单一数据大厅内多个冷却单元同时故障,触发受影响机架的热安全关闭,导致该建筑内 EC2 实例和 EBS 卷离线。
- 19:48,Coinbase 几乎所有交易暂停。零售客户无法交易或完成买卖、发送、接收、存款、取款等相关账户操作。机构客户在 Prime 上经历订单路由广泛降级。
- 恢复过程不均衡:匹配引擎于 5 月 8 日 02:25 以仅取消模式恢复,03:49 全面恢复交易;coinbase.com 和移动应用 05:30 以降级状态恢复,09:53 完全恢复;剩余事件流主题积压于 14:00 清除。
- Coinbase 已在规定窗口内通知相关监管机构,并正在完成正式影响评估。
影响解读
Coinbase 将局部云提供商事件延长为多平台数小时中断归因于两个独立可恢复但叠加的故障模式。
第一,匹配引擎绑定单一建筑。 Coinbase Exchange 匹配引擎作为基于 Raft 的复制集群运行在 AWS 集群置放组内。公司出于延迟和吞吐量需求有意选择同地部署,但缺乏自动故障转移到另一可用区的能力。当 AWS 于 21:29 终止置放组内 EC2 实例时,五个匹配引擎节点中三个下线,失去法定人数。恢复需要紧急代码更改、在受损置放组外创建新节点组,并谨慎恢复 3-of-5 法定人数。法定人数于 00:06 恢复,但市场直到 03:49 才重新开放。
第二,AWS 托管 Kafka 服务静默失败。 事件流基础设施重要部分运行在 AWS MSK 上。AWS MSK 控制平面缺陷阻止自动分区领导者重选,两个 MSK 集群卡在“修复”状态,生产者无法写入。级联效应阻塞费用服务,进而阻塞报价,导致多数客户经历交易和报价中断而非 Kafka 故障。相邻系统包括部分账本管道、支付及多个数据管道同样受影响。此外,一个 Kafka 集群配置为 2-AZ,增加了爆炸半径和恢复时间,但 MSK 控制平面缺陷对 2-AZ 和 3-AZ Kafka 集群影响类似。
关键对比表格
| 时间(美国东部时间) | 事件 |
|---|---|
| 5 月 7 日 19:20 | AWS us-east-1 区域冷却单元故障,触发机架热安全关闭 |
| 5 月 7 日 19:48 | Coinbase 几乎所有交易暂停 |
| 5 月 7 日 21:29 | AWS 终止 EC2 实例,匹配引擎失去法定人数 |
| 5 月 8 日 00:06 | 匹配引擎法定人数恢复 |
| 5 月 8 日 02:25 | 匹配引擎以仅取消模式恢复 |
| 5 月 8 日 03:00 | 手动分区重新分配,将主题迁离受损代理 |
| 5 月 8 日 03:49 | 所有订单簿全面恢复交易 |
| 5 月 8 日 05:30 | coinbase.com 和移动应用以降级状态恢复 |
| 5 月 8 日 09:30 | 优先级零和优先级一主题恢复全面可用 |
| 5 月 8 日 09:53 | coinbase.com 和移动应用完全恢复 |
| 5 月 8 日 14:00 | 剩余事件流主题积压清除 |
未来展望
Coinbase 在声明中列出可问责的承诺,而非愿景:
- 匹配引擎韧性: 改进 Coinbase Exchange 匹配引擎的热跨区备用设计;定期进行生产故障转移演练,最大交易场所参与维护窗口,其余参与沙盒演练。
- Kafka: 与 AWS 合作根因分析控制平面缺陷并确认其修复计划;开发工具、运行手册和测试以处理本次事件中出现的故障模式及 MSK 未提供的 Kafka 控制;将 2-AZ Kafka 集群迁移至 3-AZ 部署。
Coinbase 感谢协助解决问题的合作伙伴,特别感谢 AWS 工程师通宵工作及 Coinbase 工程师从初始警报至完全恢复管理事件。
编辑总结
Coinbase 此次声明以工程细节披露了 2026 年 5 月 7 日中断的完整时间线与根因。事件凸显即使设计为吸收单可用区故障的超大规模云架构,客户侧应用若缺乏自动跨区故障转移,仍可能将局部事件放大为长时间平台中断。Coinbase 承认未达可用性标准,并承诺具体改进措施。后续需关注其匹配引擎跨区热备进展、Kafka 集群迁移至 3-AZ 的完成情况,以及监管影响评估结果。
常见问题解答
问题:Coinbase 2026 年 5 月 7 日中断持续了多久?
回答:根据 Coinbase 声明,交易、存款、取款及大部分客户依赖界面不可用或降级约八小时,所有系统完全恢复又耗时十二小时。
问题:导致中断的直接原因是什么?
回答:美国东部时间 2026 年 5 月 7 日 19:20,AWS us-east-1 区域(可用区 use1-az4)单一数据大厅内多个冷却单元同时故障,触发受影响机架热安全关闭,导致 EC2 实例和 EBS 卷离线。
问题:为什么恢复耗时较长?
回答:Coinbase 指出两个叠加故障模式:匹配引擎绑定单一建筑且缺乏自动跨可用区故障转移,失去法定人数后需紧急代码更改和手动恢复;AWS MSK 控制平面缺陷阻止自动分区领导者重选,导致 Kafka 集群卡在修复状态,级联影响费用服务、报价及账本管道。
问题:Coinbase 是否通知了监管机构?
回答:是的,Coinbase 声明已在规定窗口内通知相关监管机构,并正在完成正式影响评估。
问题:Coinbase 承诺了哪些改进措施?
回答:包括改进匹配引擎热跨区备用设计并定期进行生产故障转移演练;与 AWS 合作根因分析 MSK 控制平面缺陷,开发工具和运行手册,并将 2-AZ Kafka 集群迁移至 3-AZ 部署。




