Bài viết liên quan
Hồ dữ liệu
Data Lake
Hồ dữ liệu là gì?
Hồ dữ liệu (Data Lake) là kho lưu trữ tập trung chứa dữ liệu thô ở nhiều định dạng: có cấu trúc (SQL, CSV), bán cấu trúc (JSON, XML) và phi cấu trúc (log, hình ảnh, video). Trong ngân hàng, hồ dữ liệu lưu trữ log giao dịch thẻ, lịch sử truy cập internet banking, dữ liệu clickstream, file đối soát SWIFT MT103, báo cáo tín dụng CIC và dữ liệu xuất từ core banking. Theo Thông tư 09/2020/TT-NHNN về an toàn bảo mật hệ thống CNTT, tổ chức tín dụng phải lưu trữ dữ liệu giao dịch tối thiểu 5 năm để phục vụ kiểm toán và phòng chống rửa tiền.
Đặc điểm chính
- Dung lượng mở rộng tới petabyte với chi phí thấp nhờ Hadoop, AWS S3, Azure Data Lake.
- Hỗ trợ truy vấn SQL, phân tích nâng cao và huấn luyện mô hình máy học phát hiện gian lận, chấm điểm tín dụng.
- Schema-on-read linh hoạt, không cần định nghĩa cấu trúc trước khi nạp dữ liệu.
- Tuân thủ phân vùng dữ liệu, mã hóa AES-256 theo Luật An toàn thông tin mạng 2015 và Nghị định 13/2023/NĐ-CP bảo vệ dữ liệu cá nhân.
- Tích hợp trực tiếp với Quyết định 2345/QĐ-NHNN để giám sát giao dịch và cảnh báo sớm rủi ro hoạt động.
Ví dụ thực tế
Ngân hàng TMCP Ngoại thương Việt Nam (Vietcombank) xây dựng hồ dữ liệu tập trung trên AWS S3, thu thập toàn bộ log ATM, Internet Banking và file SWIFT đối soát quốc tế. Dữ liệu được chuẩn hóa qua Apache Spark, sau đó cung cấp cho mô hình chấm điểm tín dụng nâng cao và hệ thống AI giám sát giao dịch đáng ngờ. Nhờ đó thời gian phê duyệt khoản vay giảm từ 48 giờ xuống còn 5 phút, đồng thời phát hiện sớm hơn 85% giao dịch rửa tiền tiềm ẩn theo quy định phòng chống rửa tiền của NHNN.