Hai giờ 37 phút chiều giờ miền Đông nước Mỹ, ngày 22/1/2026. Outlook, Exchange Online, Teams, SharePoint, OneDrive, Defender và Purview lần lượt rơi khỏi tầm với của người dùng.
Trong vài phút đầu, Downdetector nhận hơn 16.000 lượt báo. Lúc cao điểm, con số vượt 30.000. Người gửi thư nhận về một dòng lỗi ngắn gọn tới mức vô nghĩa với đa số: 451 4.3.2 temporary server issue.
Hạ tầng được khôi phục lúc 4 giờ 14 chiều, chưa đầy hai tiếng sau. Nhưng luồng thư chỉ chạy ổn định trở lại vào 12 giờ 33 sáng hôm sau. Microsoft mãi tới 1 giờ 29 chiều 23/1 mới tuyên bố khép sự cố. Từ lúc gãy tới lúc đóng hồ sơ là gần trọn một ngày.
Nguyên nhân: bảo trì, rồi một thao tác chữa cháy
Giải thích của Microsoft không nhắc tới tấn công hay hỏng phần cứng. Hãng nói tải dịch vụ tăng cao trong khi năng lực của một phần hạ tầng đặt tại Bắc Mỹ đang bị rút bớt để bảo trì.
Nói cách khác, hệ thống chạy với ít máy hơn bình thường, đúng lúc lượng yêu cầu không giảm theo. Phần còn lại gánh không nổi.
Phần đáng học nằm ở bước sau. Để đẩy nhanh phục hồi, đội vận hành áp một thay đổi cấu hình cân tải có chủ đích. Thao tác đó lại tạo thêm mất cân bằng lưu lượng và kéo dài sự cố. Khoảng cách giữa 4 giờ 14 chiều và 12 giờ 33 sáng hôm sau nằm ở đây.
Chi tiết ấy giải thích vì sao các đội vận hành lớn đặt ra quy tắc đóng băng thay đổi trong lúc đang có sự cố. Giữa cơn hỗn loạn, một thao tác nhằm chữa cháy rất dễ thành biến số thứ hai. Lúc đó chẳng ai còn phân biệt được hậu quả nào do đâu.
Không phải sự cố đơn lẻ
Tháng 1/2026 không chỉ có một ngày xấu. Ngày 21/1, một trục trặc mạng từ bên thứ ba đã chặn đường truy cập của một số khách hàng. Ngày 15/1, Copilot gián đoạn khoảng bốn mươi phút. Đầu tháng, một sự cố mất điện chạm tới vùng West US 2 của Azure.
Bốn sự việc trong ba tuần, ở bốn lớp khác nhau của cùng một nền tảng. Không cái nào liên quan trực tiếp tới cái nào, và chính chỗ đó mới đáng chú ý: chúng độc lập với nhau nhưng khách hàng thì chịu cộng dồn.
Ngừng thư chỉ là phần dễ thấy nhất
Microsoft 365 hiện là nền tảng làm việc mặc định ở rất nhiều doanh nghiệp Việt Nam. Khi nó ngừng, ảnh hưởng không giới hạn ở chuyện không gửi được thư. Lịch họp, tài liệu chung, kênh trao đổi nội bộ và cả hệ thống đăng nhập một lần cho các ứng dụng khác đều dừng theo.
Điểm ít ai chuẩn bị là kênh liên lạc dự phòng. Khi Teams và Outlook cùng ngừng, nhiều đội không có cách nào để nói với nhau rằng đang có sự cố. Thông báo nội bộ, danh sách điện thoại và kênh trao đổi thay thế nên nằm ở một nơi không phụ thuộc vào chính hệ thống đang hỏng.
Điểm thứ hai là hệ thống đăng nhập một lần. Nhiều doanh nghiệp đã nối các ứng dụng nội bộ và dịch vụ bên thứ ba vào tài khoản Microsoft để tiện quản lý. Cách đó gọn về vận hành nhưng gom rủi ro về một mối. Khi lớp định danh gặp vấn đề, nhân viên không vào được cả những ứng dụng chẳng liên quan gì tới Microsoft.
Điểm thứ ba ít được nói tới hơn: thư không mất, nó bị hoãn. Mã 451 là lỗi tạm, nên máy chủ gửi sẽ thử lại. Nhưng thời gian thử lại và số lần thử do bên gửi quyết định, không do bạn. Một đơn hàng, một hồ sơ dự thầu hay một thư xác nhận tới trễ tám tiếng đôi khi tệ ngang với không tới.
Chuyển lên đám mây là chuyển trách nhiệm vận hành chứ không phải xoá bỏ nó. Phần còn lại của trách nhiệm ấy tên là kế hoạch cho ngày nhà cung cấp gặp chuyện.
