Bài viết liên quan
Naive Bayes
Naive Bayes Classifier
Naive Bayes (Bộ phân loại Bayes ngây thơ)
Naive Bayes là thuật toán phân loại xác suất dựa trên Định lý Bayes, với giả định "ngây thơ" rằng các đặc trưng (features) đầu vào độc lập có điều kiện với nhau khi biết lớp phân loại. Thuật toán tính xác suất một mẫu dữ liệu thuộc về từng lớp, sau đó chọn lớp có xác suất hậu nghiệm (posterior) cao nhất.
Đặc điểm chính
- Công thức Bayes: P(C|X) = P(X|C) × P(C) / P(X)
- Giả định độc lập giữa các biến đầu vào – dù sai trong thực tế nhưng vẫn cho kết quả tốt
- Huấn luyện nhanh, phù hợp dữ liệu lớn và nhiều chiều
- Hiệu quả với bài toán phân loại văn bản, lọc thư rác, chấm điểm tín dụng
- Các biến thể phổ biến: Gaussian NB, Multinomial NB, Bernoulli NB
Ví dụ trong ngân hàng
Một ngân hàng muốn phân loại hồ sơ vay vốn thành "rủi ro thấp" hoặc "rủi ro cao" dựa trên: thu nhập (X₁), độ tuổi (X₂), lịch sử tín dụng (X₃). Naive Bayes tính P(Rủi ro cao | X₁, X₂, X₃) dựa trên xác suất có điều kiện của từng yếu tố. Nếu mô hình cho P > 0.5, hồ sơ bị đánh dấu rủi ro để chuyển phòng tín dụng thẩm định thêm.
Việc ứng dụng mô hình phân loại trong xếp hạng tín dụng được NHNN khuyến khích tại Quyết định 2345/QĐ-NHNN (2015) về hệ thống xếp hạng tín dụng nội bộ và Quyết định 1813/QĐ-NHNN (2017) về Đề án chuyển đổi số ngân hàng. Khi xử lý dữ liệu khách hàng cần tuân thủ Nghị định 13/2023/NĐ-CP về bảo vệ dữ liệu cá nhân.