Bài viết liên quan
Quản lý sự cố
Incident Management
Quản lý sự cố trong ngân hàng là gì?
Theo Phụ lục 02 Thông tư 31/2017/TT-NHNN quy định về hệ thống quản lý an toàn thông tin, các TCTD phải thiết lập quy trình quản lý sự cố bao gồm: phát hiện, phân loại mức độ, ứng phó, khôi phục và rút kinh nghiệm. Sự cố (incident) được định nghĩa là bất kỳ sự kiện nào gây ra hoặc có khả năng gây ra gián đoạn, suy giảm chất lượng dịch vụ CNTT hoặc ảnh hưởng đến hoạt động kinh doanh ngân hàng.
Mức độ phân loại sự cố
- Severity 1 (Critical): Hệ thống core banking, Internet Banking, Mobile Banking ngừng hoạt động toàn phần - SLA xử lý trong 30 phút, khôi phục trong 4 giờ.
- Severity 2 (High): Một tính năng quan trọng bị ảnh hưởng, chuyển tiền liên ngân hàng chậm - SLA xử lý trong 2 giờ.
- Severity 3 (Medium): Lỗi không ảnh hưởng trực tiếp khách hàng, báo cáo nội bộ sai - SLA 24 giờ.
- Severity 4 (Low): Yêu cầu dịch vụ, thắc mắc kỹ thuật - SLA 72 giờ.
Quy trình xử lý chuẩn ITIL
- Bước 1: Detection & Logging - Tự động cảnh báo qua hệ thống giám sát (Zabbix, Prometheus, Splunk).
- Bước 2: Categorization & Prioritization - Phân loại theo service catalog và matrix ưu tiên.
- Bước 3: Initial Diagnosis - Helpdesk Level 1 chẩn đoán sơ bộ trong 15 phút đầu.
- Bước 4: Escalation - Chuyển Level 2/3 khi vượt khả năng xử lý hoặc quá thời gian SLA.
- Bước 5: Resolution & Recovery - Khôi phục dịch vụ và xác nhận với khách hàng.
- Bước 6: Closure & Post-Incident Review - Lập báo cáo PIR trong 5 ngày làm việc cho sự cố Sev1/Sev2.
Ví dụ thực tế
Ngày 25/09/2024, hệ thống Internet Banking của một ngân hàng TMCP lớn gặp sự cố khi DNS bị tấn công, ảnh hưởng 200.000 khách hàng trong 45 phút. Sự cố được Ticket Sev1 mở lúc 14:05, L1 xử lý 10 phút không khôi phục được, escalate lên L2 lúc 14:15, team Network Security kích hoạt failover DNS dự phòng lúc 14:35, dịch vụ khôi phục hoàn toàn lúc 14:50. Tổng thời gian gián đoạn 45 phút, nằm trong ngưỡng SLA 4 giờ theo cam kết với NHNN.