Bài viết liên quan
Phân tích cụm
Cluster Analysis
Phân tích cụm (Cluster Analysis) là gì?
Phân tích cụm (Cluster Analysis) là phương pháp thống kê đa biến nhằm phân nhóm các đối tượng (khách hàng, khoản vay, chi nhánh...) vào các cụm sao cho các đối tượng trong cùng cụm có độ tương đồng cao nhất và khác biệt tối đa so với các cụm khác. Đây là kỹ thuật học máy không giám sát (unsupervised learning) được ứng dụng rộng rãi trong ngân hàng để phân khúc khách hàng, quản trị rủi ro và tối ưu danh mục.
Đặc điểm chính
- Đo lường khoảng cách: Sử dụng khoảng cách Euclid, Manhattan hoặc Mahalanobis để đánh giá mức độ tương đồng.
- Hai nhóm phương pháp: Phân cụm phân cấp (Hierarchical - Agglomerative) và phân cụm không phân cấp (K-means, K-medoids, DBSCAN).
- Tiêu chí chất lượng: Đánh giá qua chỉ số Silhouette, Within-Cluster Sum of Squares (WCSS), Gap Statistic.
- Không cần nhãn dữ liệu: Khác với phân loại (classification), phân tích cụm không yêu cầu tập dữ liệu đã gán nhãn trước.
Ví dụ minh hoạ trong ngân hàng
Một ngân hàng thương mại Việt Nam muốn phân nhóm 50.000 khách hàng cá nhân dựa trên biến: thu nhập hàng tháng, số dư tiền gửi, tần suất giao dịch, giá trị khoản vay. Áp dụng thuật toán K-means với k=4, ngân hàng xác định 4 cụm: (1) Khách hàng VIP - thu nhập cao, giao dịch nhiều; (2) Khách hàng trung lưu ổn định; (3) Khách hàng trẻ mới nổi; (4) Khách hàng rủi ro - thu nhập thấp, nợ xấu. Từ đó thiết kế chính sách lãi suất, sản phẩm thẻ tín dụng và chiến lược chăm sóc phù hợp từng cụm.
Căn cứ pháp lý: Theo Thông tư 39/2016/TT-NHNN về hoạt động cho vay của tổ chức tín dụng, việc phân nhóm khách hàng và xếp hạng tín dụng nội bộ được khuyến khích thực hiện bằng mô hình định lượng, trong đó phân tích cụm là công cụ hỗ trợ hiệu quả cho bước phân khúc trước khi xây dựng Scorecard.