[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"_public_topic_publications_ph%C3%A2n%20lo%E1%BA%A1i%20d%E1%BB%AF%20li%E1%BB%87u{\"limit\":5}":3,"_public_topic_byId_ph%C3%A2n%20lo%E1%BA%A1i%20d%E1%BB%AF%20li%E1%BB%87u":11},{"code":4,"data":5,"meta":10},"SUCCESS",{"latest":6,"mostCited":7,"vietnamFeatured":8,"vietnamLatest":9},[],[],[],[],null,{"code":4,"data":12,"meta":10},{"id":13,"title":14,"description":15,"content":16,"term":13,"englishTitle":17,"synonyms":18,"definition":21,"discipline":22,"references":23,"faqs":56,"createUser":66,"publishUser":70,"keywords":71,"keywordCount":82,"enrichTopicLink":83,"status":84,"createTime":85,"updateTime":86,"publishTime":87,"linkEnrichedTime":88,"publicationScanTime":10,"contentErrorMessage":10,"viewCount":89,"wikidataId":10,"relateTopics":90},"phân loại dữ liệu","Phân loại dữ liệu là gì? Các thuật toán và tiêu chí đánh giá","Phân loại dữ liệu là bài toán gán nhãn danh mục cho dữ liệu trong học máy có giám sát và phân định cấp độ an toàn thông tin phục vụ quản trị doanh nghiệp.","\u003Cp>Phân loại dữ liệu là quá trình xác định và gán các đối tượng dữ liệu vào một hoặc nhiều nhóm danh mục rời rạc được xác định trước dựa trên các thuộc tính hoặc đặc trưng đo lường được của chúng. Trong khoa học máy tính và trí tuệ nhân tạo, đây là bài toán nền tảng của học máy có giám sát nhằm xây dựng mô hình dự đoán nhãn lớp cho dữ liệu mới chưa từng quan sát. Trong lĩnh vực an toàn thông tin và quản trị doanh nghiệp, phân loại dữ liệu là quy trình phân định cấp độ nhạy cảm và giá trị của tài sản thông tin nhằm thiết lập các biện pháp kiểm soát an ninh tương ứng. Mục từ này trình bày mô hình toán học, các thuật toán phân loại cốt lõi, phương pháp đánh giá hiệu năng và các thách thức kỹ thuật đương đại.\u003C\u002Fp>\n\n\u003Ch2>Mô hình toán học và phân loại bài toán trong học máy\u003C\u002Fh2>\n\u003Cp>Trong {{topic|%7B%22topic%22%3A%22h%E1%BB%8Dc%20m%C3%A1y%20c%C3%B3%20gi%C3%A1m%20s%C3%A1t%22%7D}}, bài toán phân loại dữ liệu được định nghĩa một cách chặt chẽ dưới dạng học một hàm ánh xạ từ không gian thuộc tính đầu vào sang không gian nhãn lớp đầu ra.\u003C\u002Fp>\n\u003Cp>Giả sử có một tập dữ liệu huấn luyện gồm các mẫu dữ liệu độc lập cùng phân phối:\u003C\u002Fp>\n\u003Cscript type=\"math\u002Ftex; mode=display\">\\mathcal{D} = \\left\\{ (\\mathbf{x}_1, y_1), (\\mathbf{x}_2, y_2), \\dots, (\\mathbf{x}_n, y_n) \\right\\}\u003C\u002Fscript>\n\u003Cp>Trong đó mỗi vector \u003Cscript type=\"math\u002Ftex\">\\mathbf{x}_i \\in \\mathcal{X}\u003C\u002Fscript> đại diện cho một quan sát trong không gian thuộc tính nhiều chiều, và \u003Cscript type=\"math\u002Ftex\">y_i \\in \\mathcal{Y}\u003C\u002Fscript> là nhãn lớp thực tế tương ứng của quan sát đó. Mục tiêu của thuật toán học là tìm một hàm giả thuyết tối ưu \u003Cscript type=\"math\u002Ftex\">f: \\mathcal{X} \\to \\mathcal{Y}\u003C\u002Fscript> sao cho hàm tổn thất kỳ vọng trên toàn bộ phân phối dữ liệu đạt giá trị cực tiểu.\u003C\u002Fp>\n\n\u003Ch3>Các dạng bài toán phân loại dữ liệu cơ bản\u003C\u002Fh3>\n\u003Cp>Tùy thuộc vào cấu trúc và số lượng của không gian nhãn lớp \u003Cscript type=\"math\u002Ftex\">\\mathcal{Y}\u003C\u002Fscript>, bài toán phân loại được chia thành ba biến thể chính:\u003C\u002Fp>\n\u003Cul>\n\u003Cli>\u003Cstrong>Phân loại nhị phân (Binary Classification):\u003C\u002Fstrong> Không gian nhãn chỉ chứa đúng hai giá trị loại trừ lẫn nhau, thường được mã hóa thành nhãn dương và nhãn âm (ví dụ: phát hiện thư rác hoặc thư hợp lệ, chẩn đoán bệnh nhân có khối u ác tính hoặc lành tính).\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Phân loại đa lớp (Multiclass Classification):\u003C\u002Fstrong> Không gian nhãn chứa từ ba danh mục rời rạc trở lên, nhưng mỗi đối tượng dữ liệu chỉ được thuộc về duy nhất một lớp tại một thời điểm (ví dụ: phân loại chữ số viết tay từ số không đến số chín, {{topic|%7B%22topic%22%3A%22ph%C3%A2n%20lo%E1%BA%A1i%20h%C3%ACnh%20%E1%BA%A3nh%22%7D}} phương tiện giao thông thành ô tô, xe máy hoặc xe đạp).\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Phân loại đa nhãn (Multilabel Classification):\u003C\u002Fstrong> Mỗi đối tượng dữ liệu có thể được gán đồng thời nhiều nhãn lớp khác nhau trong tập danh mục (ví dụ: một bài báo khoa học có thể thuộc đồng thời cả hai thể loại {{topic|%7B%22topic%22%3A%22tr%C3%AD%20tu%E1%BB%87%20nh%C3%A2n%20t%E1%BA%A1o%22%7D}} và y sinh học).\u003C\u002Fli>\n\u003C\u002Ful>\n\n\u003Ch2>Các thuật toán phân loại dữ liệu kinh điển và hiện đại\u003C\u002Fh2>\n\u003Cp>Trải qua nhiều thập kỷ phát triển của trí tuệ nhân tạo, nhiều họ thuật toán phân loại đã được đề xuất với các nền tảng toán học và giả định phân phối khác nhau (Kotsiantis và cs., 2006).\u003C\u002Fp>\n\n\u003Ch3>1. Cây quyết định (Decision Trees)\u003C\u002Fh3>\n\u003Cp>Cây quyết định là mô hình phân loại phi tham số có cấu trúc phân cấp dạng cây, gồm các nút kiểm tra thuộc tính, các nhánh rẽ điều kiện và các nút lá đại diện cho nhãn lớp dự đoán. Năm 1986, Quinlan đã công bố thuật toán ID3 mang tính đột phá, sử dụng khái niệm entropy từ {{topic|%7B%22topic%22%3A%22l%C3%BD%20thuy%E1%BA%BFt%20th%C3%B4ng%20tin%22%7D}} để định lượng độ hỗn loạn của dữ liệu:\u003C\u002Fp>\n\u003Cscript type=\"math\u002Ftex; mode=display\">H(S) = -\\sum_{i=1}^c p_i \\log_2(p_i)\u003C\u002Fscript>\n\u003Cp>Trong công thức trên, ký hiệu \u003Cscript type=\"math\u002Ftex\">H(S)\u003C\u002Fscript> biểu thị độ hỗn loạn entropy của tập mẫu dữ liệu \u003Cscript type=\"math\u002Ftex\">S\u003C\u002Fscript>, tham số \u003Cscript type=\"math\u002Ftex\">c\u003C\u002Fscript> là tổng số lớp danh mục, và đại lượng \u003Cscript type=\"math\u002Ftex\">p_i\u003C\u002Fscript> là xác suất xuất hiện của lớp thứ \u003Cscript type=\"math\u002Ftex\">i\u003C\u002Fscript> trong tập mẫu. Thuật toán của Quinlan (1986) tính toán độ tăng lượng thông tin (Information Gain) để lựa chọn thuộc tính phân tách tối ưu nhất tại mỗi nút quyết định. Ưu điểm nổi bật của cây quyết định là tính minh bạch, dễ diễn giải và có thể trực quan hóa thành các tập luật logic cho con người thẩm định.\u003C\u002Fp>\n\n\u003Ch3>2. Máy vector hỗ trợ (Support Vector Machines - SVM)\u003C\u002Fh3>\n\u003Cp>Được phát triển bởi Cortes và Vapnik (1995), máy vector hỗ trợ tiếp cận bài toán phân loại dưới góc nhìn hình học không gian. Thuật toán tìm kiếm một siêu phẳng phân tách tuyến tính tối ưu sao cho khoảng cách lề giữa siêu phẳng và các điểm dữ liệu gần nhất của hai lớp (gọi là các vector hỗ trợ) đạt giá trị cực đại.\u003C\u002Fp>\n\u003Cp>Khi dữ liệu không thể phân tách tuyến tính trong không gian ban đầu, Cortes và Vapnik (1995) đã áp dụng kỹ thuật hàm nhân (Kernel Trick) để ánh xạ các điểm dữ liệu lên không gian đặc trưng nhiều chiều hơn mà không cần tính toán tọa độ tường minh trong không gian mới. Nhờ nguyên lý cực tiểu hóa rủi ro cấu trúc, SVM sở hữu khả năng tổng quát hóa xuất sắc và hạn chế tối đa hiện tượng quá khớp (overfitting) trên các tập dữ liệu số chiều cao.\u003C\u002Fp>\n\n\u003Ch3>3. Học quần thể và Rừng ngẫu nhiên (Random Forests)\u003C\u002Fh3>\n\u003Cp>Để khắc phục nhược điểm nhạy cảm với nhiễu và độ lệch phương sai lớn của cây quyết định đơn lẻ, Breiman (2001) đã đề xuất thuật toán Rừng ngẫu nhiên (Random Forests). Thuật toán này kết hợp hàng trăm cây quyết định riêng lẻ bằng kỹ thuật lấy mẫu tái lập kết hợp ngẫu nhiên hóa không gian thuộc tính:\u003C\u002Fp>\n\u003Ctable>\n\u003Cthead>\n\u003Ctr>\n\u003Cth>Phương pháp phân loại\u003C\u002Fth>\n\u003Cth>Nguyên lý hoạt động cốt lõi\u003C\u002Fth>\n\u003Cth>Ưu điểm chính\u003C\u002Fth>\n\u003Cth>Nhược điểm và hạn chế\u003C\u002Fth>\n\u003C\u002Ftr>\n\u003C\u002Fthead>\n\u003Ctbody>\n\u003Ctr>\n\u003Ctd>Cây quyết định (Quinlan, 1986)\u003C\u002Ftd>\n\u003Ctd>Phân chia đệ quy không gian dữ liệu dựa trên độ tăng thông tin\u003C\u002Ftd>\n\u003Ctd>Dễ hiểu, trực quan, tốc độ xử lý nhanh\u003C\u002Ftd>\n\u003Ctd>Dễ rơi vào bẫy quá khớp, phương sai cao với dữ liệu nhỏ\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Máy vector hỗ trợ (Cortes và Vapnik, 1995)\u003C\u002Ftd>\n\u003Ctd>Cực đại hóa khoảng cách lề phân tách và sử dụng hàm nhân\u003C\u002Ftd>\n\u003Ctd>Độ chính xác cao trên dữ liệu số chiều lớn, cơ sở toán vững\u003C\u002Ftd>\n\u003Ctd>Chi phí tính toán cao với tập dữ liệu hàng triệu mẫu\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Rừng ngẫu nhiên (Breiman, 2001)\u003C\u002Ftd>\n\u003Ctd>Tập hợp đa cây quyết định với chọn mẫu ngẫu nhiên bagging\u003C\u002Ftd>\n\u003Ctd>Độ chính xác rất cao, kiểm soát phương sai tốt, chống nhiễu\u003C\u002Ftd>\n\u003Ctd>Mất đi tính trực quan đơn giản của cây đơn lẻ, tốn bộ nhớ\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Mạng nơ-ron sâu (Deep Neural Networks)\u003C\u002Ftd>\n\u003Ctd>Học biểu diễn đặc trưng phi tuyến qua nhiều lớp ẩn liên tiếp\u003C\u002Ftd>\n\u003Ctd>Tự động {{topic|%7B%22topic%22%3A%22tr%C3%ADch%20xu%E1%BA%A5t%20%C4%91%E1%BA%B7c%20tr%C6%B0ng%22%7D}} từ ảnh, văn bản và âm thanh\u003C\u002Ftd>\n\u003Ctd>Đòi hỏi tài nguyên tính toán lớn và khó giải thích nội tại\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003C\u002Ftbody>\n\u003C\u002Ftable>\n\n\u003Ch2>Đánh giá hiệu năng mô hình phân loại dữ liệu\u003C\u002Fh2>\n\u003Cp>Việc đánh giá độ chính xác của mô hình phân loại không thể chỉ dựa vào một chỉ số đơn thuần mà đòi hỏi sự phân tích toàn diện qua ma trận nhầm lẫn (Confusion Matrix).\u003C\u002Fp>\n\n\u003Ch3>1. Ma trận nhầm lẫn và các chỉ số đo lường cơ bản\u003C\u002Fh3>\n\u003Cp>Đối với bài toán {{topic|%7B%22topic%22%3A%22ph%C3%A2n%20lo%E1%BA%A1i%20nh%E1%BB%8B%20ph%C3%A2n%22%7D}}, ma trận nhầm lẫn phân định kết quả dự đoán thành bốn trường hợp:\u003C\u002Fp>\n\u003Cul>\n\u003Cli>\u003Cstrong>Dương tính thật (TP):\u003C\u002Fstrong> Mẫu thực tế là dương và {{topic|%7B%22topic%22%3A%22m%C3%B4%20h%C3%ACnh%20d%E1%BB%B1%20%C4%91o%C3%A1n%22%7D}} chính xác là dương.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Âm tính thật (TN):\u003C\u002Fstrong> Mẫu thực tế là âm và mô hình dự đoán chính xác là âm.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Dương tính giả (FP):\u003C\u002Fstrong> Mẫu thực tế là âm nhưng mô hình dự đoán sai thành dương (sai lầm loại một).\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Âm tính giả (FN):\u003C\u002Fstrong> Mẫu thực tế là dương nhưng mô hình bỏ sót và dự đoán là âm (sai lầm loại hai).\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>Từ bốn tham số này, các chỉ số đo lường độ chính xác (Precision), độ nhạy (Recall) và điểm điều hòa F1 được xác định:\u003C\u002Fp>\n\u003Cscript type=\"math\u002Ftex; mode=display\">F_1 = 2 \\cdot \\frac{\\text{Precision} \\cdot \\text{Recall}}{\\text{Precision} + \\text{Recall}}\u003C\u002Fscript>\n\u003Cp>Điểm số F1 đạt giá trị cao nhất khi cả độ chính xác và độ nhạy đều cân bằng, là thước đo đặc biệt quan trọng trong các bài toán dữ liệu có phân bố lệch lớn.\u003C\u002Fp>\n\n\u003Ch3>2. Đường cong ROC và chỉ số AUC\u003C\u002Fh3>\n\u003Cp>Trong các ứng dụng thực tiễn, nhiều mô hình phân loại đưa ra xác suất liên tục thay vì nhãn nhị phân dứt khoát. Theo nghiên cứu chuyên sâu của Fawcett (2006), đường cong đặc trưng hoạt động máy thu ROC (Receiver Operating Characteristic) biểu diễn tương quan giữa tỷ lệ dương tính thật (độ nhạy) và tỷ lệ dương tính giả trên tất cả các ngưỡng phân loại có thể có.\u003C\u002Fp>\n\u003Cp>Diện tích dưới đường cong ROC (chỉ số AUC) cung cấp thước đo tổng quát về khả năng phân biệt lớp của mô hình độc lập hoàn toàn với việc lựa chọn ngưỡng quyết định cụ thể. Chỉ số AUC nhận giá trị từ mức nửa điểm (phân loại ngẫu nhiên không có giá trị phân biệt) đến một điểm trọn vẹn (mô hình phân loại hoàn hảo không có sai số) (Fawcett, 2006).\u003C\u002Fp>\n\n\u003Ch2>Phân loại dữ liệu trong an toàn thông tin và quản trị dữ liệu\u003C\u002Fh2>\n\u003Cp>Bên cạnh lĩnh vực trí tuệ nhân tạo, phân loại dữ liệu giữ vai trò then chốt trong quản trị an ninh mạng doanh nghiệp. Quy trình này phân nhóm tài sản thông tin dựa trên mức độ bảo mật cần thiết:\u003C\u002Fp>\n\u003Cul>\n\u003Cli>\u003Cstrong>Dữ liệu công khai (Public):\u003C\u002Fstrong> Thông tin không nhạy cảm có thể tự do công bố ra bên ngoài mà không gây tổn hại uy tín hoặc tài chính của tổ chức (ví dụ: thông cáo báo chí, tài liệu quảng cáo).\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Dữ liệu nội bộ (Internal):\u003C\u002Fstrong> Thông tin phục vụ vận hành hàng ngày chỉ lưu hành nội bộ nhân viên, sự rò rỉ có thể gây bất tiện nhỏ nhưng không dẫn đến tổn thất lớn.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Dữ liệu bảo mật (Confidential):\u003C\u002Fstrong> Thông tin độc quyền, báo cáo tài chính nội bộ, hợp đồng khách hàng đòi hỏi quyền truy cập hạn chế theo nguyên tắc quyền tối thiểu.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Dữ liệu tối mật hoặc hạn chế (Restricted):\u003C\u002Fstrong> Thông tin tối mật mang tính sống còn như bí mật thương mại, mã khóa mật mã hoặc dữ liệu cá nhân nhạy cảm phải tuân thủ các quy định pháp luật nghiêm ngặt.\u003C\u002Fli>\n\u003C\u002Ful>\n\n\u003Ch2>Thách thức kỹ thuật và định hướng nghiên cứu hiện đại\u003C\u002Fh2>\n\u003Cp>Mặc dù các kỹ thuật phân loại dữ liệu đã đạt được những thành tựu to lớn, các hệ thống triển khai thực tế vẫn đối mặt với những rào cản căn bản:\u003C\u002Fp>\n\u003Cul>\n\u003Cli>\u003Cstrong>Mất cân bằng dữ liệu nghiêm trọng (Class Imbalance):\u003C\u002Fstrong> Trong các bài toán phát hiện gian lận thẻ tín dụng hoặc chẩn đoán bệnh hiếm, số mẫu lớp thiểu số chỉ chiếm tỷ lệ cực nhỏ. Các mô hình truyền thống thường có xu hướng dự đoán thiên vị hoàn toàn về lớp đa số để đạt độ chính xác ảo.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Hiện tượng trôi dạt khái niệm (Concept Drift):\u003C\u002Fstrong> Bản chất {{topic|%7B%22topic%22%3A%22ph%C3%A2n%20ph%E1%BB%91i%20th%E1%BB%91ng%20k%C3%AA%22%7D}} của dữ liệu trong thực tế liên tục biến thiên theo thời gian (ví dụ: hành vi lừa đảo qua mạng liên tục đổi mới thủ đoạn), khiến mô hình đã được huấn luyện bị suy giảm hiệu năng nếu không được cập nhật kịp thời.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Định lý không có bữa trưa miễn phí:\u003C\u002Fstrong> Tổng quan của Kotsiantis và cs. (2006) khẳng định không tồn tại bất kỳ một thuật toán phân loại đơn lẻ nào vượt trội tối ưu trên mọi tập dữ liệu và mọi miền ứng dụng. Việc lựa chọn mô hình luôn đòi hỏi sự thấu hiểu sâu sắc bản chất dữ liệu, sự cân bằng giữa độ chính xác và chi phí tính toán.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Trí tuệ nhân tạo có thể giải thích (Explainable AI - XAI):\u003C\u002Fstrong> Các mạng nơ-ron học sâu hiện đại thường hoạt động như những hộp đen bí ẩn. Trong các lĩnh vực có tính rủi ro cao như y tế, pháp lý và tài chính, việc phát triển các phương pháp giải thích cơ chế phân loại (như SHAP, LIME) là điều kiện bắt buộc để xây dựng niềm tin của xã hội.\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>Xu hướng {{topic|%7B%22topic%22%3A%22nghi%C3%AAn%20c%E1%BB%A9u%20t%C6%B0%C6%A1ng%20lai%22%7D}} đang thúc đẩy sự kết hợp giữa học tự giám sát, học tăng cường và các {{topic|%7B%22topic%22%3A%22h%E1%BB%87%20th%E1%BB%91ng%20ph%C3%A2n%20lo%E1%BA%A1i%22%7D}} bảo toàn quyền riêng tư phân tán để giải quyết bài toán xử lý dữ liệu quy mô lớn trong kỷ nguyên điện toán đám mây.\u003C\u002Fp>\n","data classification",[19,20,17],"phân lớp dữ liệu","bài toán phân loại","Phân loại dữ liệu là quá trình gán các đối tượng dữ liệu vào một hoặc nhiều nhóm danh mục rời rạc được xác định trước dựa trên các thuộc tính đo lường được của chúng. Trong học máy có giám sát, đây là nhiệm vụ huấn luyện mô hình để dự đoán nhãn lớp cho các quan sát mới, đồng thời là quy trình phân cấp độ nhạy cảm thông tin trong quản trị bảo mật.","ENGINEERING_TECHNOLOGY",[24,31,37,43,50],{"citationText":25,"title":26,"authors":27,"source":28,"year":29,"doi":30,"url":10},"Quinlan, J. R. (1986). Induction of decision trees. Machine Learning, 1(1), 81-106.","Induction of decision trees","Quinlan","Machine Learning",1986,"10.1007\u002Fbf00116251",{"citationText":32,"title":33,"authors":34,"source":28,"year":35,"doi":36,"url":10},"Cortes, C., & Vapnik, V. (1995). Support-vector networks. Machine Learning, 20(3), 273-297.","Support-vector networks","Cortes, Vapnik",1995,"10.1007\u002Fbf00994018",{"citationText":38,"title":39,"authors":40,"source":28,"year":41,"doi":42,"url":10},"Breiman, L. (2001). Random Forests. Machine Learning, 45(1), 5-32.","Random Forests","Breiman",2001,"10.1023\u002Fa:1010933404324",{"citationText":44,"title":45,"authors":46,"source":47,"year":48,"doi":49,"url":10},"Fawcett, T. (2006). An introduction to ROC analysis. Pattern Recognition Letters, 27(8), 861-874.","An introduction to ROC analysis","Fawcett","Pattern Recognition Letters",2006,"10.1016\u002Fj.patrec.2005.10.010",{"citationText":51,"title":52,"authors":53,"source":54,"year":48,"doi":55,"url":10},"Kotsiantis, S. B., Zaharakis, I., & Pintelas, P. (2006). Machine learning: a review of classification and combining techniques. Artificial Intelligence Review, 26(3), 159-190.","Machine learning: a review of classification and combining techniques","Kotsiantis, Zaharakis, Pintelas","Artificial Intelligence Review","10.1007\u002Fs10462-007-9052-3",[57,60,63],{"question":58,"answer":59},"Sự khác biệt cơ bản giữa phân loại dữ liệu và phân cụm dữ liệu là gì?","Phân loại dữ liệu là bài toán học có giám sát với các nhãn lớp đã được định nghĩa và gán sẵn trong tập huấn luyện, trong khi phân cụm dữ liệu là bài toán học không giám sát nhằm tự động tìm kiếm các nhóm đối tượng tương đồng mà không có nhãn lớp biết trước.",{"question":61,"answer":62},"Khi dữ liệu bị mất cân bằng lớp nghiêm trọng, chỉ số đánh giá nào nên được ưu tiên?","Khi dữ liệu bị lệch lớp nghiêm trọng, độ chính xác tổng thể phản ánh sai lệch hiệu năng; các chỉ số như điểm F1, đường cong Precision-Recall và diện tích dưới đường cong ROC (AUC) phản ánh trung thực khả năng nhận diện lớp thiểu số của mô hình.",{"question":64,"answer":65},"Phân loại dữ liệu trong an toàn thông tin có vai trò gì đối với doanh nghiệp?","Phân loại dữ liệu giúp doanh nghiệp nhận diện các tài sản thông tin nhạy cảm và bí mật kinh doanh để áp dụng các chính sách mã hóa, kiểm soát quyền truy cập và sao lưu dữ liệu phù hợp với các tiêu chuẩn an ninh mạng quốc tế.",{"id":67,"researcherId":10,"name":68,"imageUrl":69},1,"Nguyễn Ngọc Sơn","https:\u002F\u002Flh3.googleusercontent.com\u002Fa\u002FACg8ocLGfGsF1nYQqYK5BasTLhNu1dBrBXg2fcEgBNPXJ0p2gqLQnO7i=s96-c",{"id":67,"researcherId":10,"name":68,"imageUrl":69},[72,73,74,75,76,77,78,79,80,81],"học máy có giám sát","phân loại hình ảnh","trí tuệ nhân tạo","lý thuyết thông tin","trích xuất đặc trưng","phân loại nhị phân","mô hình dự đoán","phân phối thống kê","nghiên cứu tương lai","hệ thống phân loại",10,true,"PUBLISHED","2025-12-01T09:55:14.234+00:00","2026-09-12T20:09:53.347+00:00","2026-09-12T19:13:39.798+00:00","2026-09-12T20:09:53.016+00:00",0,[91,94,97,100,103,106,109,112,115,118],{"id":92,"title":93,"term":92,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"ngữ nghĩa","Ngữ nghĩa là gì? Các nghiên cứu khoa học về Ngữ nghĩa",{"id":95,"title":96,"term":95,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"mô hình lý thuyết","Mô hình lý thuyết là gì? Các nghiên cứu về Mô hình lý thuyết",{"id":98,"title":99,"term":98,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"hình thái","Hình thái là gì? Các công bố khoa học về Hình thái",{"id":101,"title":102,"term":101,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"chất lượng thông tin","Chất lượng thông tin là gì? Nghiên cứu khoa học liên quan",{"id":104,"title":105,"term":104,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"autonomy","Autonomy là gì? Các công bố khoa học về Autonomy",{"id":107,"title":108,"term":107,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"nghiên cứu tổng quan","Nghiên cứu tổng quan là gì? Các bài báo nghiên cứu khoa học",{"id":110,"title":111,"term":110,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"tối ưu hoá","Tối ưu hoá là gì? Các nghiên cứu khoa học về Tối ưu hoá",{"id":113,"title":114,"term":113,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"phương pháp đại số","Phương pháp đại số là gì? Các nghiên cứu khoa học liên quan",{"id":116,"title":117,"term":116,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"phương pháp luận","Phương pháp luận là gì? Các nghiên cứu khoa học liên quan",{"id":119,"title":120,"term":119,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"năng lực chuyên môn","Năng lực chuyên môn là gì? Các nghiên cứu về Năng lực chuyên môn"]