Ngày 7/5/2026, Amazon Web Services lại gặp sự cố tại vùng Bắc Virginia. Lần này nguyên nhân không nằm ở phần mềm. AWS gọi đó là một sự kiện nhiệt.
Nhiều cụm làm lạnh trong cùng một phòng máy hỏng đồng thời. Nhiệt độ vượt ngưỡng an toàn, và máy chủ tự tắt để bảo vệ phần cứng. Khu vực bị ảnh hưởng là một vùng sẵn sàng duy nhất, mang mã use1-az4.
Hệ thống làm mát ổn định trở lại khoảng hai mươi tiếng sau đó. Phần lớn dịch vụ hồi phục cùng lúc, nhưng các dịch vụ nặng về dữ liệu cần thêm thời gian. Tổng cộng khoảng hai mươi tám tiếng.
Vì sao mất gần trọn một ngày
Điểm ít người ngoài ngành hình dung được là thứ tự bắt buộc của các bước.
Không thể bật máy lên ngay khi thợ sửa xong cụm làm lạnh. Phòng máy phải nguội xuống dưới ngưỡng an toàn trước đã, rồi mới cấp điện lại cho từng dãy tủ. Bật sớm là hỏng thêm phần cứng.
Quãng chờ nguội ấy là lý do sự cố tính bằng ngày chứ không bằng giờ. Nó cũng là loại thời gian không rút ngắn được bằng cách thêm người hay thêm tiền.
Có thiệt hại vật lý thật. Việc mất điện đột ngột làm hỏng một phần máy chủ và ổ đĩa trên các tủ bị ảnh hưởng. Không phải mọi thứ bật lại là chạy.
Khoản đền bù AWS đưa ra là tín dụng dịch vụ khoảng 10% hoá đơn tính toán của phần bị ảnh hưởng. Đặt cạnh bảy tiếng ngừng giao dịch của một sàn, con số đó nói lên bản chất của mọi cam kết mức dịch vụ. Nó bồi thường cho tiền thuê máy, không bồi thường cho doanh thu mất đi.
Năm nút mà vẫn sập
Theo thống kê của bên theo dõi trạng thái dịch vụ, hơn 150 dịch vụ đám mây khác nhau ghi nhận ảnh hưởng.
Sàn giao dịch tiền số Coinbase ngừng khoảng bảy tiếng. Hệ thống khớp lệnh của họ mất khả năng đạt đồng thuận khi ba trong năm nút cùng ngoại tuyến. Nền tảng cá cược FanDuel sập giữa một trận đấu bóng rổ vòng loại trực tiếp. Sàn giao dịch hàng hoá CME Group cũng gián đoạn.
Chi tiết về Coinbase đáng nghĩ kỹ. Họ đã làm đúng bài toán phân tán với năm nút. Nhưng nếu cả năm nút cùng nằm trong phạm vi một sự cố vật lý thì con số năm không giúp gì.
Phân tán chỉ có nghĩa khi các bản sao thật sự không chia sẻ điểm hỏng chung. Câu hỏi đặt ra là về địa lý, không phải về phần mềm — và không có thư viện nào trả lời hộ được.
Nhóm chịu nặng nhất là những hệ thống đặt trọn trong một vùng sẵn sàng. Với họ, sự cố này là mất trắng cả ngày. Nhóm có bản sao ở vùng sẵn sàng khác chuyển hướng được, dù không phải lúc nào cũng êm.
Làm mát là chuyện gần chứ không xa
Chuyện làm mát nghe xa vời với người dùng đám mây. Nhưng nó rất gần với doanh nghiệp đang đặt máy tại trung tâm dữ liệu trong nước, và gần hơn nữa với những nơi tự dựng phòng máy nội bộ.
Điều hoà, nguồn điện dự phòng và cảm biến nhiệt là ba thứ dễ bị coi là chuyện của bộ phận kỹ thuật toà nhà. Cho tới hôm chúng hỏng.
RBE vận hành hạ tầng đặt tại Viettel IDC và VNPT cho hơn 1.800 doanh nghiệp. Điều dễ thấy là phần lớn khách hàng không hỏi về hạ tầng điện lạnh khi chọn nhà cung cấp. Câu hỏi đó đáng hỏi, kèm theo câu hỏi về việc dữ liệu của mình có bản sao ở địa điểm vật lý khác hay không.
Có một điểm nữa mà sự cố này làm rõ. Khu vực sẵn sàng trong một vùng đám mây được thiết kế để độc lập về điện và làm mát. Nhưng độc lập ở mức thiết kế không có nghĩa là không bao giờ hỏng.
Ở đây chỉ một khu vực bị ảnh hưởng, và như thế đã đủ để hơn 150 dịch vụ ghi nhận gián đoạn. Con số ấy nói lên mức độ tập trung của khối lượng công việc nhiều hơn là nói về AWS.
Còn một điều đáng lưu ý cho vài năm tới. Mật độ điện trong trung tâm dữ liệu đang tăng nhanh vì các hệ thống tính toán cho trí tuệ nhân tạo. Nhiều điện hơn nghĩa là nhiều nhiệt hơn, trên cùng một mét vuông sàn. Sự kiện nhiệt sẽ không hiếm đi.
