Cách thiết kế phương án dự phòng khi xảy ra lỗi
- Xác định trước lỗi nào cần phương án dự phòng
- Thiết kế phương án dự phòng theo cơ chế thay thế và phục hồi
- Xác định điều kiện chuyển sang phương án dự phòng
- Bảo đảm dữ liệu và trạng thái có thể phục hồi
- So sánh dự phòng nóng, dự phòng từng phần và phương án thủ công
- Kiểm thử phương án dự phòng trước khi xảy ra lỗi thật
- Đặt giới hạn và điểm kết thúc cho phương án dự phòng
- Biến phương án dự phòng thành quy trình có thể thực thi
NIST xem contingency planning là một quá trình bao gồm đánh giá tác động, xác định biện pháp phòng ngừa, xây dựng chiến lược phục hồi, lập kế hoạch, kiểm thử và duy trì kế hoạch. Các chiến lược có thể bao gồm thiết bị thay thế, xử lý thủ công hoặc chuyển hoạt động sang địa điểm thay thế tùy mức độ gián đoạn và yêu cầu vận hành.
Xác định trước lỗi nào cần phương án dự phòng
Không phải mọi lỗi đều cần một cơ chế dự phòng giống nhau. Bước đầu tiên là lập danh sách các tình huống có thể làm gián đoạn chức năng quan trọng, chẳng hạn:
· Thiết bị chính ngừng hoạt động
· Mất kết nối hoặc mất nguồn
· Dữ liệu bị hỏng hoặc không thể truy cập
· Phần mềm hoặc dịch vụ phụ thuộc bị lỗi
· Cấu hình thay đổi gây mất ổn định
· Nhân sự hoặc quy trình xử lý chính không khả dụng
Sau đó cần xác định với mỗi lỗi: chức năng nào bị ảnh hưởng, mức độ ảnh hưởng là gì, có thể duy trì hoạt động tạm thời bằng cách nào và cần phục hồi hoàn toàn trong bao lâu.
Điểm quan trọng là không thiết kế dự phòng theo danh sách thiết bị đơn thuần. Một thiết bị có thể được thay thế nhưng nếu dữ liệu, cấu hình hoặc quyền truy cập không thể khôi phục thì chức năng thực tế vẫn chưa được dự phòng.

Thiết kế phương án dự phòng theo cơ chế thay thế và phục hồi
Một phương án hoàn chỉnh nên được chia thành hai lớp: thay thế khi lỗi xảy ra và phục hồi sau khi hoạt động đã được duy trì.
Cơ chế thay thế
Cơ chế thay thế xác định phương án nào sẽ tiếp quản khi thành phần chính không còn hoạt động. Tùy hệ thống, có thể sử dụng:
· Thành phần dự phòng có sẵn để chuyển đổi
· Thiết bị hoặc máy chủ thay thế
· Hệ thống dự phòng tại vị trí khác
· Dịch vụ hoặc nhà cung cấp thay thế
· Quy trình thủ công trong thời gian ngắn
NIST cũng liệt kê các cách tiếp cận như failover tự động, hệ thống dự phòng, máy chủ cụm, hệ thống được sao chiếu và thiết bị cung cấp điện liên tục trong nhóm chiến lược phục hồi có thể cân nhắc. Việc lựa chọn phải phụ thuộc vào tác động của gián đoạn và yêu cầu vận hành, thay vì mặc định rằng một cơ chế là phù hợp cho mọi hệ thống.
Cơ chế phục hồi
Sau khi phương án thay thế đã giúp duy trì hoạt động, cần có bước đưa hệ thống về trạng thái ổn định. Cơ chế phục hồi nên xác định:
1. Trạng thái nào được xem là đã phục hồi
2. Dữ liệu nào phải được khôi phục
3. Thứ tự khôi phục các thành phần
4. Điều kiện để chuyển từ hệ thống dự phòng về hệ thống chính
5. Cách kiểm tra tính toàn vẹn sau phục hồi
6. Cách ghi nhận và xử lý dữ liệu phát sinh trong thời gian chạy dự phòng
Như vậy, thay thế giúp giảm thời gian gián đoạn, còn phục hồi giúp đưa hệ thống về trạng thái vận hành bình thường. Hai cơ chế này cần được thiết kế cùng nhau.
Xác định điều kiện chuyển sang phương án dự phòng
Phương án dự phòng dễ thất bại nếu chỉ ghi chung chung rằng “khi hệ thống lỗi thì chuyển sang hệ thống dự phòng”. Cần xác định rõ ngưỡng kích hoạt.
Có thể quy định theo các điều kiện như:
· Thành phần chính không thể phục hồi trong khoảng thời gian cho phép
· Lỗi làm gián đoạn chức năng quan trọng
· Dữ liệu chính không còn khả dụng
· Chỉ số vận hành vượt ngưỡng an toàn đã định
· Bộ phận chịu trách nhiệm xác nhận tình trạng lỗi
Đồng thời cần quy định quyền quyết định: lỗi nào được tự động chuyển đổi, lỗi nào cần con người xác nhận và trường hợp nào phải dừng toàn bộ hệ thống thay vì chuyển sang phương án dự phòng.
Điều này tránh hai rủi ro ngược nhau: chuyển đổi quá sớm khi hệ thống chính vẫn có thể phục hồi hoặc chuyển đổi quá muộn khiến thiệt hại đã xảy ra.
Bảo đảm dữ liệu và trạng thái có thể phục hồi
Một phương án thay thế không đủ nếu chỉ thay được phần cứng hoặc dịch vụ. Hệ thống dự phòng phải có khả năng tiếp nhận dữ liệu và trạng thái cần thiết để tiếp tục công việc.
Cần xác định:
· Dữ liệu nào phải sao lưu
· Sao lưu với tần suất nào
· Bản sao được lưu ở đâu
· Ai có quyền khôi phục
· Cách kiểm tra bản sao có thể sử dụng
· Trạng thái nào được xem là phiên bản phục hồi hợp lệ
NIST nhấn mạnh rằng chiến lược backup và recovery cần gắn với mức độ tác động của gián đoạn, thời gian ngừng cho phép và yêu cầu vận hành; nơi lưu trữ bản sao và tần suất sao lưu cũng là những yếu tố cần được xác định trước.
Điểm cần tránh là có bản sao nhưng chưa từng kiểm tra khả năng phục hồi. Một bản sao chỉ thực sự là thành phần của phương án dự phòng khi có thể được khôi phục trong điều kiện thực tế.
So sánh dự phòng nóng, dự phòng từng phần và phương án thủ công
Không phải hệ thống nào cũng cần duy trì một bản sao hoạt động hoàn toàn song song.
|
Phương án |
Cách hoạt động |
Điểm mạnh |
Giới hạn |
|
Dự phòng sẵn sàng cao |
Thành phần thay thế gần như sẵn sàng tiếp quản |
Giảm thời gian gián đoạn |
Chi phí và độ phức tạp cao hơn |
|
Dự phòng từng phần |
Chỉ duy trì các thành phần quan trọng để phục hồi |
Cân bằng chi phí và khả năng phục hồi |
Cần thêm thời gian khôi phục |
|
Phương án thủ công |
Con người sử dụng quy trình thay thế tạm thời |
Chi phí đầu tư thấp hơn |
Phụ thuộc nhân sự, tốc độ và độ chính xác |
Lựa chọn phải dựa trên hậu quả của lỗi và thời gian phục hồi chấp nhận được. Không nên mặc định rằng phương án có mức dự phòng cao nhất luôn là phương án tốt nhất, vì chi phí, độ phức tạp và yêu cầu vận hành cũng tăng theo.
Kiểm thử phương án dự phòng trước khi xảy ra lỗi thật
Một phương án chưa được kiểm thử mới chỉ là giả định.
Kiểm thử cần mô phỏng đúng các bước mà người vận hành sẽ thực hiện khi xảy ra lỗi:
1. Tạo hoặc mô phỏng điều kiện lỗi
2. Xác nhận điều kiện kích hoạt
3. Thực hiện chuyển đổi
4. Kiểm tra khả năng tiếp tục hoạt động
5. Kiểm tra dữ liệu và trạng thái
6. Thực hiện phục hồi
7. Đối chiếu kết quả với tiêu chí ban đầu
8. Ghi nhận thời gian, lỗi phát sinh và điểm cần cải thiện
NIST cũng xem testing, training/exercises và maintenance là những thành phần của quy trình contingency planning, thay vì coi kế hoạch là tài liệu chỉ cần lập một lần.
Một phương án kiểm thử tốt phải kiểm tra cả đường đi chính và đường quay về: chuyển sang dự phòng được hay không và sau đó có thể phục hồi về trạng thái vận hành bình thường hay không.
Đặt giới hạn và điểm kết thúc cho phương án dự phòng
Phương án dự phòng không phải lúc nào cũng có thể duy trì vô thời hạn. Cần xác định rõ:
· Thời gian phương án dự phòng có thể hoạt động
· Mức hiệu năng chấp nhận được khi chạy dự phòng
· Những chức năng có thể tạm thời bị hạn chế
· Điều kiện phải dừng phương án dự phòng
· Điều kiện được phép chuyển về hệ thống chính
Ví dụ, một quy trình thủ công có thể phù hợp để duy trì hoạt động trong thời gian ngắn nhưng không nhất thiết đủ cho một giai đoạn gián đoạn kéo dài. NIST cũng phân biệt các phương án phục hồi dựa trên loại gián đoạn và thời gian cần duy trì hoạt động thay thế.
Vì vậy, cần có boundary cho phương án dự phòng: nó dùng trong tình huống nào, đến mức nào và khi nào phải chuyển sang phương án phục hồi hoặc phương án khác.
Biến phương án dự phòng thành quy trình có thể thực thi
Một phương án tốt cần đủ cụ thể để người khác có thể thực hiện mà không phải tự suy đoán.
Tối thiểu nên ghi rõ:
· Điều kiện kích hoạt
· Người có quyền kích hoạt
· Thành phần thay thế
· Dữ liệu và cấu hình cần chuẩn bị
· Trình tự chuyển đổi
· Cách xác nhận chuyển đổi thành công
· Cách tiếp tục vận hành
· Trình tự phục hồi
· Điều kiện chuyển về hệ thống chính
· Cách kiểm thử và cập nhật phương án
Nếu một bước quan trọng chỉ tồn tại dưới dạng “xử lý khi có sự cố”, phương án vẫn còn thiếu cơ chế vận hành cụ thể.
Khi thiết kế phương án dự phòng, mục tiêu không phải là tạo ra càng nhiều lớp thay thế càng tốt mà là bảo đảm chức năng quan trọng có thể tiếp tục hoặc được phục hồi trong giới hạn chấp nhận được. Cách tiếp cận hiệu quả là xác định lỗi và tác động trước, chọn cơ chế thay thế phù hợp, bảo đảm dữ liệu và trạng thái có thể phục hồi, đặt điều kiện kích hoạt rõ ràng, sau đó kiểm thử cả chuyển đổi lẫn phục hồi.
Một phương án dự phòng thực sự sẵn sàng khi người vận hành biết khi nào kích hoạt, chuyển sang đâu, duy trì hoạt động bằng cách nào, phục hồi ra sao và giới hạn của phương án nằm ở đâu.
