Bài viết liên quan
K-Nearest Neighbors
K-Nearest Neighbors (KNN)
K-Nearest Neighbors (KNN) - Thuật toán K láng giềng gần nhất
KNN là thuật toán học có giám sát (supervised learning) thuộc nhóm lazy learning, dùng để phân loại hoặc hồi quy. Ý tưởng cốt lõi: một mẫu dữ liệu mới sẽ được gán nhãn dựa trên phiếu bầu đa số (majority voting) của K điểm dữ liệu huấn luyện gần nhất trong không gian đặc trưng.
Đặc điểm chính
- Độ đo khoảng cách: Euclidean, Manhattan hoặc Minkowski
- Chọn K: K lẻ để tránh hòa phiếu (K=3, 5, 7); K nhỏ dễ overfitting, K lớn dễ underfitting
- Không có giai đoạn huấn luyện (instance-based learning)
- Chi phí dự đoán cao vì phải duyệt toàn bộ tập dữ liệu
- Nhạy cảm với đơn vị đo → cần chuẩn hóa dữ liệu bằng Min-Max hoặc Z-score
Ví dụ trong ngân hàng
Ngân hàng dùng KNN (K=5) để phát hiện giao dịch gian lận thẻ tín dụng. Khi một giao dịch mới phát sinh, hệ thống tìm 5 giao dịch lịch sử có đặc trưng (số tiền, địa điểm, thời gian, loại merchant) gần nhất. Nếu ≥3/5 giao dịch được gán nhãn "gian lận", giao dịch mới bị cảnh báo realtime. Mô hình cũng ứng dụng trong phân khúc khách hàng (segmentation) và xếp hạng tín dụng theo Quyết định 2345/QĐ-NHNN (2015). Việc thu thập và xử lý dữ liệu khách hàng phải tuân thủ Luật An toàn thông tin mạng 2015 và Nghị định 13/2023/NĐ-CP về bảo vệ dữ liệu cá nhân.