Phân loại nhị phân (binary classification) là một dạng bài toán kinh điển và cơ bản nhất trong học máy có giám sát (supervised machine learning) và thống kê học ứng dụng, trong đó nhiệm vụ của mô hình thuật toán là học một ánh xạ dự đoán từ một vector không gian đặc trưng đầu vào vào một trong hai nhóm nhãn rời rạc loại trừ lẫn nhau (thường được quy ước là lớp âm tính và lớp dương tính ).
Ma trận nhầm lẫn (Confusion Matrix) và Các thước đo đánh giá cốt lõi
Hiệu năng dự đoán của một bộ phân loại nhị phân trên tập dữ liệu kiểm thử được tóm tắt qua ma trận :
| Nhãn thực tế (Actual) \ Nhãn dự đoán (Predicted) | Dự đoán Dương tính () | Dự đoán Âm tính () |
|---|---|---|
| Thực tế Dương tính () | TP (True Positive): Dương tính thật | FN (False Negative): Âm tính giả (Sai lầm loại II) |
| Thực tế Âm tính () | FP (False Positive): Dương tính giả (Sai lầm loại I) | TN (True Negative): Âm tính thật |
Từ các ô cơ sở này, các chỉ số đo lường hiệu năng quan trọng nhất được định nghĩa:
1. Độ chính xác tổng thể (Accuracy)
Chỉ số này phản ánh tỷ lệ dự đoán đúng trên toàn bộ mẫu. Tuy nhiên, nếu tập dữ liệu bị mất cân bằng lớp nặng (ví dụ: 99% mẫu âm tính, 1% mẫu dương tính), một mô hình tầm thường luôn đoán nhãn 0 vẫn đạt Accuracy = 99% nhưng vô giá trị.
2. Độ nhạy / Tỷ lệ dương tính thật (Recall / Sensitivity / TPR)
Khả năng của mô hình bắt trọn được bao nhiêu phần trăm các ca dương tính thực tế trong quần thể (tối quan trọng trong chẩn đoán y khoa, tầm soát ung thư để tránh bỏ sót ca bệnh).
3. Độ chuẩn xác (Precision / Positive Predictive Value - PPV)
Trong số tất cả các ca mà mô hình dự đoán là dương tính, có bao nhiêu phần trăm thực sự là dương tính đúng (quan trọng trong phát hiện thư rác spam hoặc cảnh báo gian lận giao dịch để tránh báo động giả).
4. Điểm F1 (F1-Score)
Điểm F1 là trung bình điều hòa giữa Precision và Recall, đạt giá trị cao nhất là 1 khi cả hai chỉ số đều hoàn hảo.
Phân tích Đường cong ROC và Chỉ số ROC-AUC
Hầu hết các thuật toán phân loại hiện đại không đưa ra nhãn nhị phân trực tiếp mà dự đoán một giá trị xác suất liên tục . Một mẫu được gán nhãn 1 nếu (với là ngưỡng quyết định phân loại - classification threshold, mặc định là 0.5).
- Đường cong ROC (Receiver Operating Characteristic Curve): Là đồ thị biểu diễn mối quan hệ giữa Độ nhạy () trên trục tung và Tỷ lệ dương tính giả () trên trục hoành khi ngưỡng quét liên tục từ 1 về 0 (Fawcett, 2006).
- Chỉ số AUC (Area Under the ROC Curve): Diện tích nằm dưới đường cong ROC đo lường xác suất một mẫu dương tính ngẫu nhiên được mô hình xếp hạng xác suất cao hơn một mẫu âm tính ngẫu nhiên:
- : Mô hình hoàn toàn không có khả năng phân biệt (tương đương tung đồng xu ngẫu nhiên).
- : Khả năng phân biệt chấp nhận được.
- : Khả năng phân biệt xuất sắc.
- : Khả năng phân biệt vượt trội (gần như hoàn hảo).
Các thuật toán phân loại nhị phân phổ biến
| Mô hình thuật toán | Nguyên lý phân loại cốt lõi | Ưu điểm nổi bật | Hạn chế chính |
|---|---|---|---|
| Hồi quy Logistic (Logistic Regression) | Sử dụng hàm Sigmoid \sigma(z) = rac{1}{1 + e^{-z}} mô hình hóa logit xác suất | Đơn giản, tính toán nhanh, hệ số hồi quy (Odd Ratios) dễ giải thích | Chỉ tìm được ranh giới quyết định tuyến tính |
| Máy vectơ hỗ trợ (Support Vector Machine - SVM) | Tìm siêu phẳng phân cách cực đại hóa lề (Margin) kết hợp biến đổi Kernel phi tuyến | Hiệu quả cao trong không gian số chiều lớn, chống quá khớp tốt | Huấn luyện chậm trên tập dữ liệu rất lớn |
| Cây quyết định & Rừng ngẫu nhiên (Random Forest) | Tập hợp (Ensemble) nhiều cây quyết định kết hợp lấy mẫu Bagging | Xử lý tốt đặc trưng phi tuyến và dữ liệu dạng bảng, không cần chuẩn hóa | Mô hình kích thước lớn, khó suy diễn xác suất mượt |
| Gradient Boosting (XGBoost, LightGBM, CatBoost) | Xây dựng chuỗi cây quyết định tuần tự sửa chữa sai số của các cây trước | Độ chính xác thuộc nhóm cao nhất đối với dữ liệu dạng bảng có cấu trúc | Nhiều siêu tham số cần tinh chỉnh cẩn thận |
| Mạng thần kinh nhân tạo (Deep Neural Networks) | Nhiều lớp ẩn phi tuyến với hàm kích hoạt Sigmoid ở tầng đầu ra và mất mát Binary Cross-Entropy | Học biểu diễn đặc trưng tự động vượt trội từ dữ liệu phi cấu trúc (ảnh, văn bản) | Đòi hỏi dữ liệu huấn luyện rất lớn, chi phí phần cứng GPU cao |