AWS sập nguồn, một nửa thế giới buồn điên đảo
Ngày 20/10, Amazon Web Services (AWS) ngừng hoạt động "ở mức nghiêm trọng", khiến hàng loạt dịch vụ trực tuyến chạy trên nền tảng này như Alexa, Snapchat, Netflix, Disney+, Tinder, Roku; các game Fortnite, League of Legends; Perplexity... không thể truy cập hoặc chạy chậm như sên, người dùng rên như thiến.
Các công ty và người dùng trên toàn cầu đã trải qua sự gián đoạn hiếm gặp (quen thuộc) sau sự cố ngừng hoạt động của AWS liên quan đến DynamoDB.
"AWS gặp tình trạng gia tăng tỷ lệ lỗi đối với các dịch vụ AWS tại Khu vực US-EAST-1, điều này cũng ảnh hưởng đến Amazon.com và các công ty con của Amazon, cũng như hoạt động hỗ trợ từ AWS", công ty cho biết trong bài đăng trên blog về sự cố ngừng hoạt động tạm thời này.
Theo Amazon, nguyên nhân do sự cố DNS ảnh hưởng đến điểm cuối Bắc Virginia của họ. Hệ thống tên miền (DNS) chịu trách nhiệm dịch tên miền đã viết thành địa chỉ IP tương ứng, cho phép người dùng nhập URL của trang web thay vì chuỗi số là địa chỉ IP của máy chủ.
Theo thông tin chi tiết trong bản tóm tắt sự cố của công ty, lỗi liên quan đến dịch vụ DynamoDB. Dịch vụ này chịu trách nhiệm cập nhật bản ghi DNS, phân phối lưu lượng và xử lý các sự cố vận hành hoàn toàn automation, mặc dù Amazon cho biết một nhân viên vận hành thủ công đã can thiệp kịp thời để giải quyết lỗi tự động hóa.
Sự cố này đã nêu bật những cạm bẫy có thể phát sinh khi công ty chỉ phụ thuộc vào một nhà cung cấp dịch vụ đám mây duy nhất mà không có kế hoạch dự phòng trong trường hợp dịch vụ bị gián đoạn.
Thiết lập thêm một nhà cung cấp dịch vụ đám mây dự phòng có thể tiếp quản realtime khi có biến là điều cần thiết (nhưng tốn kém gấp đôi) đặc biệt trong các ngành có rủi ro cao như y tế sức khoẻ và tài chính ngân hàng.