Bài viết liên quan
Random Forest
Random Forest
Random Forest là gì?
Random Forest (Rừng ngẫu nhiên) là phương pháp học máy thuộc nhóm ensemble learning, kết hợp nhiều cây quyết định (decision trees) để đưa ra dự đoán cuối cùng. Thuật toán được Leo Breiman đề xuất năm 2001, hoạt động theo nguyên tắc bagging: mỗi cây được huấn luyện trên một tập con dữ liệu lấy mẫu bootstrap (có hoàn lại) và sử dụng tập đặc trưng ngẫu nhiên tại mỗi nút phân chia.
Đặc điểm chính
- Tính đa dạng: Hàng trăm cây độc lập giúp giảm hiện tượng overfitting so với một cây đơn lẻ.
- Bootstrap Aggregating: Mỗi cây huấn luyện trên ~63% dữ liệu gốc (out-of-bag dùng để đánh giá).
- Feature Randomness: Tại mỗi nút chỉ chọn ngẫu nhiên √p đặc trưng (phân loại) hoặc p/3 (hồi quy).
- Cơ chế tổng hợp: Đa số phiếu bầu cho phân loại, trung bình cho hồi quy.
- Đánh giá quan trọng biến: Cung cấp chỉ số feature importance phục vụ giải thích mô hình.
Ví dụ trong ngân hàng Việt Nam
Ngân hàng TMCP Á Châu (ACB) triển khai mô hình Random Forest gồm 300 cây để xây dựng hệ thống chấm điểm tín dụng khách hàng cá nhân, kết hợp các biến: thu nhập, lịch sử trả nợ, độ tuổi, ngành nghề, thời gian làm việc. Theo Quyết định 2345/QĐ-NHNN năm 2023 về hệ thống xếp hạng tín dụng nội bộ và Thông tư 11/2021/TT-NHNN, các ngân hàng được khuyến khích ứng dụng phân tích dữ liệu lớn và học máy. Kết quả cho thấy AUC của Random Forest đạt 0.89, vượt trội so với 0.78 của mô hình logistic truyền thống, giúp giảm 15% tỷ lệ nợ xấu nhóm 3-5.