Từ điển học thuật Kỹ thuật và công nghệ

Phân loại dữ liệu là gì? Các thuật toán và tiêu chí đánh giá

Tiếng Anhdata classification

Tên gọi khácphân lớp dữ liệubài toán phân loạidata classification

Phân loại dữ liệu là quá trình gán các đối tượng dữ liệu vào một hoặc nhiều nhóm danh mục rời rạc được xác định trước dựa trên các thuộc tính đo lường được của chúng. Trong học máy có giám sát, đây là nhiệm vụ huấn luyện mô hình để dự đoán nhãn lớp cho các quan sát mới, đồng thời là quy trình phân cấp độ nhạy cảm thông tin trong quản trị bảo mật.

Cập nhật 12/9/2026

Phân loại dữ liệu là quá trình xác định và gán các đối tượng dữ liệu vào một hoặc nhiều nhóm danh mục rời rạc được xác định trước dựa trên các thuộc tính hoặc đặc trưng đo lường được của chúng. Trong khoa học máy tính và trí tuệ nhân tạo, đây là bài toán nền tảng của học máy có giám sát nhằm xây dựng mô hình dự đoán nhãn lớp cho dữ liệu mới chưa từng quan sát. Trong lĩnh vực an toàn thông tin và quản trị doanh nghiệp, phân loại dữ liệu là quy trình phân định cấp độ nhạy cảm và giá trị của tài sản thông tin nhằm thiết lập các biện pháp kiểm soát an ninh tương ứng. Mục từ này trình bày mô hình toán học, các thuật toán phân loại cốt lõi, phương pháp đánh giá hiệu năng và các thách thức kỹ thuật đương đại.

Mô hình toán học và phân loại bài toán trong học máy

Trong học máy có giám sát, bài toán phân loại dữ liệu được định nghĩa một cách chặt chẽ dưới dạng học một hàm ánh xạ từ không gian thuộc tính đầu vào sang không gian nhãn lớp đầu ra.

Giả sử có một tập dữ liệu huấn luyện gồm các mẫu dữ liệu độc lập cùng phân phối:

D={(x1,y1),(x2,y2),…,(xn,yn)}\mathcal{D} = \left\{ (\mathbf{x}_1, y_1), (\mathbf{x}_2, y_2), \dots, (\mathbf{x}_n, y_n) \right\}

Trong đó mỗi vector xi∈X\mathbf{x}_i \in \mathcal{X} đại diện cho một quan sát trong không gian thuộc tính nhiều chiều, và yi∈Yy_i \in \mathcal{Y} là nhãn lớp thực tế tương ứng của quan sát đó. Mục tiêu của thuật toán học là tìm một hàm giả thuyết tối ưu f:X→Yf: \mathcal{X} \to \mathcal{Y} sao cho hàm tổn thất kỳ vọng trên toàn bộ phân phối dữ liệu đạt giá trị cực tiểu.

Các dạng bài toán phân loại dữ liệu cơ bản

Tùy thuộc vào cấu trúc và số lượng của không gian nhãn lớp Y\mathcal{Y}, bài toán phân loại được chia thành ba biến thể chính:

  • Phân loại nhị phân (Binary Classification): Không gian nhãn chỉ chứa đúng hai giá trị loại trừ lẫn nhau, thường được mã hóa thành nhãn dương và nhãn âm (ví dụ: phát hiện thư rác hoặc thư hợp lệ, chẩn đoán bệnh nhân có khối u ác tính hoặc lành tính).
  • Phân loại đa lớp (Multiclass Classification): Không gian nhãn chứa từ ba danh mục rời rạc trở lên, nhưng mỗi đối tượng dữ liệu chỉ được thuộc về duy nhất một lớp tại một thời điểm (ví dụ: phân loại chữ số viết tay từ số không đến số chín, phân loại hình ảnh phương tiện giao thông thành ô tô, xe máy hoặc xe đạp).
  • Phân loại đa nhãn (Multilabel Classification): Mỗi đối tượng dữ liệu có thể được gán đồng thời nhiều nhãn lớp khác nhau trong tập danh mục (ví dụ: một bài báo khoa học có thể thuộc đồng thời cả hai thể loại trí tuệ nhân tạo và y sinh học).

Các thuật toán phân loại dữ liệu kinh điển và hiện đại

Trải qua nhiều thập kỷ phát triển của trí tuệ nhân tạo, nhiều họ thuật toán phân loại đã được đề xuất với các nền tảng toán học và giả định phân phối khác nhau (Kotsiantis và cs., 2006).

1. Cây quyết định (Decision Trees)

Cây quyết định là mô hình phân loại phi tham số có cấu trúc phân cấp dạng cây, gồm các nút kiểm tra thuộc tính, các nhánh rẽ điều kiện và các nút lá đại diện cho nhãn lớp dự đoán. Năm 1986, Quinlan đã công bố thuật toán ID3 mang tính đột phá, sử dụng khái niệm entropy từ lý thuyết thông tin để định lượng độ hỗn loạn của dữ liệu:

H(S)=−∑i=1cpilog⁡2(pi)H(S) = -\sum_{i=1}^c p_i \log_2(p_i)

Trong công thức trên, ký hiệu H(S)H(S) biểu thị độ hỗn loạn entropy của tập mẫu dữ liệu SS, tham số cc là tổng số lớp danh mục, và đại lượng pip_i là xác suất xuất hiện của lớp thứ ii trong tập mẫu. Thuật toán của Quinlan (1986) tính toán độ tăng lượng thông tin (Information Gain) để lựa chọn thuộc tính phân tách tối ưu nhất tại mỗi nút quyết định. Ưu điểm nổi bật của cây quyết định là tính minh bạch, dễ diễn giải và có thể trực quan hóa thành các tập luật logic cho con người thẩm định.

2. Máy vector hỗ trợ (Support Vector Machines - SVM)

Được phát triển bởi Cortes và Vapnik (1995), máy vector hỗ trợ tiếp cận bài toán phân loại dưới góc nhìn hình học không gian. Thuật toán tìm kiếm một siêu phẳng phân tách tuyến tính tối ưu sao cho khoảng cách lề giữa siêu phẳng và các điểm dữ liệu gần nhất của hai lớp (gọi là các vector hỗ trợ) đạt giá trị cực đại.

Khi dữ liệu không thể phân tách tuyến tính trong không gian ban đầu, Cortes và Vapnik (1995) đã áp dụng kỹ thuật hàm nhân (Kernel Trick) để ánh xạ các điểm dữ liệu lên không gian đặc trưng nhiều chiều hơn mà không cần tính toán tọa độ tường minh trong không gian mới. Nhờ nguyên lý cực tiểu hóa rủi ro cấu trúc, SVM sở hữu khả năng tổng quát hóa xuất sắc và hạn chế tối đa hiện tượng quá khớp (overfitting) trên các tập dữ liệu số chiều cao.

3. Học quần thể và Rừng ngẫu nhiên (Random Forests)

Để khắc phục nhược điểm nhạy cảm với nhiễu và độ lệch phương sai lớn của cây quyết định đơn lẻ, Breiman (2001) đã đề xuất thuật toán Rừng ngẫu nhiên (Random Forests). Thuật toán này kết hợp hàng trăm cây quyết định riêng lẻ bằng kỹ thuật lấy mẫu tái lập kết hợp ngẫu nhiên hóa không gian thuộc tính:

Phương pháp phân loại Nguyên lý hoạt động cốt lõi Ưu điểm chính Nhược điểm và hạn chế
Cây quyết định (Quinlan, 1986) Phân chia đệ quy không gian dữ liệu dựa trên độ tăng thông tin Dễ hiểu, trực quan, tốc độ xử lý nhanh Dễ rơi vào bẫy quá khớp, phương sai cao với dữ liệu nhỏ
Máy vector hỗ trợ (Cortes và Vapnik, 1995) Cực đại hóa khoảng cách lề phân tách và sử dụng hàm nhân Độ chính xác cao trên dữ liệu số chiều lớn, cơ sở toán vững Chi phí tính toán cao với tập dữ liệu hàng triệu mẫu
Rừng ngẫu nhiên (Breiman, 2001) Tập hợp đa cây quyết định với chọn mẫu ngẫu nhiên bagging Độ chính xác rất cao, kiểm soát phương sai tốt, chống nhiễu Mất đi tính trực quan đơn giản của cây đơn lẻ, tốn bộ nhớ
Mạng nơ-ron sâu (Deep Neural Networks) Học biểu diễn đặc trưng phi tuyến qua nhiều lớp ẩn liên tiếp Tự động trích xuất đặc trưng từ ảnh, văn bản và âm thanh Đòi hỏi tài nguyên tính toán lớn và khó giải thích nội tại

Đánh giá hiệu năng mô hình phân loại dữ liệu

Việc đánh giá độ chính xác của mô hình phân loại không thể chỉ dựa vào một chỉ số đơn thuần mà đòi hỏi sự phân tích toàn diện qua ma trận nhầm lẫn (Confusion Matrix).

1. Ma trận nhầm lẫn và các chỉ số đo lường cơ bản

Đối với bài toán phân loại nhị phân, ma trận nhầm lẫn phân định kết quả dự đoán thành bốn trường hợp:

  • Dương tính thật (TP): Mẫu thực tế là dương và mô hình dự đoán chính xác là dương.
  • Âm tính thật (TN): Mẫu thực tế là âm và mô hình dự đoán chính xác là âm.
  • Dương tính giả (FP): Mẫu thực tế là âm nhưng mô hình dự đoán sai thành dương (sai lầm loại một).
  • Âm tính giả (FN): Mẫu thực tế là dương nhưng mô hình bỏ sót và dự đoán là âm (sai lầm loại hai).

Từ bốn tham số này, các chỉ số đo lường độ chính xác (Precision), độ nhạy (Recall) và điểm điều hòa F1 được xác định:

F1=2⋅Precision⋅RecallPrecision+RecallF_1 = 2 \cdot \frac{\text{Precision} \cdot \text{Recall}}{\text{Precision} + \text{Recall}}

Điểm số F1 đạt giá trị cao nhất khi cả độ chính xác và độ nhạy đều cân bằng, là thước đo đặc biệt quan trọng trong các bài toán dữ liệu có phân bố lệch lớn.

2. Đường cong ROC và chỉ số AUC

Trong các ứng dụng thực tiễn, nhiều mô hình phân loại đưa ra xác suất liên tục thay vì nhãn nhị phân dứt khoát. Theo nghiên cứu chuyên sâu của Fawcett (2006), đường cong đặc trưng hoạt động máy thu ROC (Receiver Operating Characteristic) biểu diễn tương quan giữa tỷ lệ dương tính thật (độ nhạy) và tỷ lệ dương tính giả trên tất cả các ngưỡng phân loại có thể có.

Diện tích dưới đường cong ROC (chỉ số AUC) cung cấp thước đo tổng quát về khả năng phân biệt lớp của mô hình độc lập hoàn toàn với việc lựa chọn ngưỡng quyết định cụ thể. Chỉ số AUC nhận giá trị từ mức nửa điểm (phân loại ngẫu nhiên không có giá trị phân biệt) đến một điểm trọn vẹn (mô hình phân loại hoàn hảo không có sai số) (Fawcett, 2006).

Phân loại dữ liệu trong an toàn thông tin và quản trị dữ liệu

Bên cạnh lĩnh vực trí tuệ nhân tạo, phân loại dữ liệu giữ vai trò then chốt trong quản trị an ninh mạng doanh nghiệp. Quy trình này phân nhóm tài sản thông tin dựa trên mức độ bảo mật cần thiết:

  • Dữ liệu công khai (Public): Thông tin không nhạy cảm có thể tự do công bố ra bên ngoài mà không gây tổn hại uy tín hoặc tài chính của tổ chức (ví dụ: thông cáo báo chí, tài liệu quảng cáo).
  • Dữ liệu nội bộ (Internal): Thông tin phục vụ vận hành hàng ngày chỉ lưu hành nội bộ nhân viên, sự rò rỉ có thể gây bất tiện nhỏ nhưng không dẫn đến tổn thất lớn.
  • Dữ liệu bảo mật (Confidential): Thông tin độc quyền, báo cáo tài chính nội bộ, hợp đồng khách hàng đòi hỏi quyền truy cập hạn chế theo nguyên tắc quyền tối thiểu.
  • Dữ liệu tối mật hoặc hạn chế (Restricted): Thông tin tối mật mang tính sống còn như bí mật thương mại, mã khóa mật mã hoặc dữ liệu cá nhân nhạy cảm phải tuân thủ các quy định pháp luật nghiêm ngặt.

Thách thức kỹ thuật và định hướng nghiên cứu hiện đại

Mặc dù các kỹ thuật phân loại dữ liệu đã đạt được những thành tựu to lớn, các hệ thống triển khai thực tế vẫn đối mặt với những rào cản căn bản:

  • Mất cân bằng dữ liệu nghiêm trọng (Class Imbalance): Trong các bài toán phát hiện gian lận thẻ tín dụng hoặc chẩn đoán bệnh hiếm, số mẫu lớp thiểu số chỉ chiếm tỷ lệ cực nhỏ. Các mô hình truyền thống thường có xu hướng dự đoán thiên vị hoàn toàn về lớp đa số để đạt độ chính xác ảo.
  • Hiện tượng trôi dạt khái niệm (Concept Drift): Bản chất phân phối thống kê của dữ liệu trong thực tế liên tục biến thiên theo thời gian (ví dụ: hành vi lừa đảo qua mạng liên tục đổi mới thủ đoạn), khiến mô hình đã được huấn luyện bị suy giảm hiệu năng nếu không được cập nhật kịp thời.
  • Định lý không có bữa trưa miễn phí: Tổng quan của Kotsiantis và cs. (2006) khẳng định không tồn tại bất kỳ một thuật toán phân loại đơn lẻ nào vượt trội tối ưu trên mọi tập dữ liệu và mọi miền ứng dụng. Việc lựa chọn mô hình luôn đòi hỏi sự thấu hiểu sâu sắc bản chất dữ liệu, sự cân bằng giữa độ chính xác và chi phí tính toán.
  • Trí tuệ nhân tạo có thể giải thích (Explainable AI - XAI): Các mạng nơ-ron học sâu hiện đại thường hoạt động như những hộp đen bí ẩn. Trong các lĩnh vực có tính rủi ro cao như y tế, pháp lý và tài chính, việc phát triển các phương pháp giải thích cơ chế phân loại (như SHAP, LIME) là điều kiện bắt buộc để xây dựng niềm tin của xã hội.

Xu hướng nghiên cứu tương lai đang thúc đẩy sự kết hợp giữa học tự giám sát, học tăng cường và các hệ thống phân loại bảo toàn quyền riêng tư phân tán để giải quyết bài toán xử lý dữ liệu quy mô lớn trong kỷ nguyên điện toán đám mây.

Câu hỏi thường gặp

Sự khác biệt cơ bản giữa phân loại dữ liệu và phân cụm dữ liệu là gì?

Phân loại dữ liệu là bài toán học có giám sát với các nhãn lớp đã được định nghĩa và gán sẵn trong tập huấn luyện, trong khi phân cụm dữ liệu là bài toán học không giám sát nhằm tự động tìm kiếm các nhóm đối tượng tương đồng mà không có nhãn lớp biết trước.

Khi dữ liệu bị mất cân bằng lớp nghiêm trọng, chỉ số đánh giá nào nên được ưu tiên?

Khi dữ liệu bị lệch lớp nghiêm trọng, độ chính xác tổng thể phản ánh sai lệch hiệu năng; các chỉ số như điểm F1, đường cong Precision-Recall và diện tích dưới đường cong ROC (AUC) phản ánh trung thực khả năng nhận diện lớp thiểu số của mô hình.

Phân loại dữ liệu trong an toàn thông tin có vai trò gì đối với doanh nghiệp?

Phân loại dữ liệu giúp doanh nghiệp nhận diện các tài sản thông tin nhạy cảm và bí mật kinh doanh để áp dụng các chính sách mã hóa, kiểm soát quyền truy cập và sao lưu dữ liệu phù hợp với các tiêu chuẩn an ninh mạng quốc tế.

Tài liệu tham khảo

  1. Quinlan, J. R. (1986). Induction of decision trees. Machine Learning, 1(1), 81-106. DOI: 10.1007/bf00116251
  2. Cortes, C., & Vapnik, V. (1995). Support-vector networks. Machine Learning, 20(3), 273-297. DOI: 10.1007/bf00994018
  3. Breiman, L. (2001). Random Forests. Machine Learning, 45(1), 5-32. DOI: 10.1023/a:1010933404324
  4. Fawcett, T. (2006). An introduction to ROC analysis. Pattern Recognition Letters, 27(8), 861-874. DOI: 10.1016/j.patrec.2005.10.010
  5. Kotsiantis, S. B., Zaharakis, I., & Pintelas, P. (2006). Machine learning: a review of classification and combining techniques. Artificial Intelligence Review, 26(3), 159-190. DOI: 10.1007/s10462-007-9052-3