Từ điển học thuật Kỹ thuật và công nghệ

Máy học là gì? Khái niệm, cơ chế và ứng dụng

Tiếng AnhMachine learning (ML)

Máy học (machine learning) là phân ngành của trí tuệ nhân tạo tập trung nghiên cứu và phát triển các thuật toán có khả năng tự động học hỏi quy luật từ dữ liệu thực nghiệm để đưa ra dự đoán hoặc quyết định mà không cần lập trình tường minh.

301 lượt xem Cập nhật 12/9/2026

Máy học (machine learning - ML) là phân ngành của trí tuệ nhân tạo tập trung nghiên cứu và phát triển các thuật toán có khả năng tự động học hỏi quy luật từ dữ liệu thực nghiệm để đưa ra dự đoán hoặc quyết định mà không cần lập trình tường minh.

Bản chất toán học và phân loại các mô hình học máy

Về mặt hình thức toán học, bài toán máy học hướng tới việc xấp xỉ một hàm mục tiêu f:XoYf: X o Y ánh xạ từ không gian đặc trưng đầu vào XX sang không gian nhãn đầu ra YY. Quá trình tối ưu hóa trọng số mô hình được thực hiện thông qua việc cực tiểu hóa hàm mất mát (loss function) trên tập dữ liệu huấn luyện:

\min_{ heta} rac{1}{N} \sum_{i=1}^N \mathcal{L}(f(x_i; heta), y_i) + \lambda \Omega( heta)

Trong đó L\mathcal{L} là hàm mất mát đo lường sai số dự đoán, heta heta là tập tham số của mô hình, và Ω(heta)\Omega( heta) là số hạng điều chuẩn (regularization term) với hệ số phạt λ\lambda nhằm ngăn ngừa hiện tượng quá khớp (overfitting).

Máy học được phân chia thành bốn mô hình học tập căn bản:

  • Học có giám sát (Supervised Learning): Tập dữ liệu huấn luyện bao gồm cả đặc trưng đầu vào và nhãn đích chính xác. Bao gồm hai bài toán lớn là bài toán hồi quy (regression - dự đoán giá trị liên tục) và bài toán phân loại (classification - gán nhãn rời rạc). Các thuật toán kinh điển gồm Hồi quy tuyến tính, Máy vector hỗ trợ (SVM), Rừng ngẫu nhiên (Random Forest) và Gradient Boosting.
  • Học không giám sát (Unsupervised Learning): Dữ liệu đầu vào hoàn toàn không có nhãn chỉ định trước. Mô hình tự động khám phá cấu trúc tiềm ẩn, mẫu hình phân cụm hoặc phân phối xác suất. Điển hình là các thuật toán phân cụm K-means, phân tích thành phần chính (PCA) và mô hình hỗn hợp Gauss (GMM).
  • Học nửa giám sát (Semi-supervised Learning): Kết hợp một lượng nhỏ dữ liệu đã gắn nhãn với một lượng lớn dữ liệu chưa gán nhãn để cải thiện độ chính xác phân loại trong khi tiết kiệm chi phí gán nhãn thủ công.
  • Học tăng cường (Reinforcement Learning - RL): Một tác tử (agent) tương tác liên tục với môi trường động, tự học chính sách hành động tối ưu thông qua cơ chế thử - sai nhằm cực đại hóa tổng phần thưởng tích lũy dài hạn.
Mô hình học Đặc điểm dữ liệu đầu vào Hàm mất mát / Mục tiêu tối ưu Thuật toán tiêu biểu
Hồi quy có giám sát Đặc trưng liên tục + Nhãn liên tục Sai số toàn phương trung bình (MSE / RMSE) Linear Regression, Ridge, Lasso, SVR
Phân loại có giám sát Đặc trưng đa chiều + Nhãn phân loại Hàm mất mát Entropy chéo (Cross-Entropy Loss) Logistic Regression, SVM, XGBoost, LightGBM
Phân cụm không giám sát Tập vector đặc trưng không nhãn Tổng bình phương khoảng cách nội cụm (Inertia) K-Means, DBSCAN, Phân cụm thứ bậc (Hierarchical)
Giảm chiều dữ liệu Ma trận dữ liệu nhiều chiều Cực đại hóa phương sai chiếu hoặc bảo toàn khoảng cách PCA, t-SNE, UMAP

Vấn đề cân bằng độ chệch - phương sai (Bias-Variance Tradeoff)

Một thách thức cốt lõi trong máy học là sự cân bằng giữa độ chệch (bias) và phương sai (variance) của mô hình. Một mô hình quá đơn giản (underfitting) sẽ có độ chệch cao, không nắm bắt được bản chất dữ liệu. Ngược lại, một mô hình quá phức tạp với dung lượng tham số lớn sẽ học cả nhiễu ngẫu nhiên trong tập huấn luyện, dẫn đến phương sai cao và thất bại khi khái quát hóa trên tập dữ liệu kiểm tra độc lập.

Các giải pháp kỹ thuật chuẩn mực để kiểm soát phương sai bao gồm:

  • Kiểm định chéo k-lớp (k-fold cross-validation): Chia dữ liệu ngẫu nhiên thành k phần bằng nhau để luân phiên huấn luyện và đánh giá.
  • Điều chuẩn L1 (Lasso) và L2 (Ridge): Bổ sung chuẩn trọng số vào hàm mất mát để triệt tiêu hoặc thu nhỏ các hệ số dư thừa.
  • Kỹ thuật kết hợp mô hình (Ensemble learning): Kết hợp nhiều bộ phân loại yếu thông qua Bagging (như Random Forest) hoặc Boosting (như AdaBoost, CatBoost) để giảm đồng thời cả độ chệch và phương sai.

Sự chuyển dịch sang học sâu và mô hình nền tảng

Trong khi máy học cổ điển phụ thuộc nặng nề vào bước trích xuất đặc trưng thủ công (feature engineering) đòi hỏi kiến thức chuyên gia sâu của từng ngành, học sâu (Deep Learning) sử dụng các kiến trúc mạng nơ-ron sâu nhiều tầng ẩn để tự động học biểu diễn đặc trưng phân tầng từ dữ liệu thô. Xu hướng hiện đại tiếp tục phát triển mạnh mẽ với các mô hình biến đổi Transformer, mạng nơ-ron sinh đối kháng (GAN) và các mô hình nền tảng (Foundation Models) có khả năng giải quyết đồng thời nhiều nhiệm vụ đa phương thức phức tạp.

Kỹ nghệ đặc trưng và tiền xử lý dữ liệu (Feature Engineering)

Trong quy trình triển khai máy học thực tế, chất lượng và cách biểu diễn dữ liệu đầu vào đóng vai trò quyết định đến 80% hiệu năng của mô hình. Kỹ nghệ đặc trưng là quá trình chuyển đổi dữ liệu thô thành các biểu diễn có ý nghĩa toán học giúp thuật toán học tập hiệu quả nhất:

  • Chuẩn hóa thang đo (Feature Scaling): Các thuật toán dựa trên khoảng cách (như KNN, SVM) hoặc tối ưu hóa theo gradient (như Hồi quy logistic, Mạng nơ-ron) đòi hỏi dữ liệu phải được đưa về cùng thang đo thông qua Chuẩn hóa chuẩn mực (Standardization: đưa về trung bình bằng 0, độ lệch chuẩn bằng 1) hoặc Co giãn Min-Max (Min-Max Normalization: đưa về khoảng [0, 1]).
  • Mã hóa biến phân loại (Categorical Encoding): Chuyển đổi các biến định tính thành số thông qua Mã hóa One-Hot (One-Hot Encoding) đối với biến danh nghĩa không thứ bậc hoặc Mã hóa nhãn (Ordinal/Label Encoding) đối với biến có thứ tự cấp bậc.
  • Xử lý dữ liệu mất mát (Imputation): Khắc phục các giá trị khuyết thiếu bằng cách điền giá trị trung bình/trung vị cho biến liên tục, điền mode cho biến phân loại, hoặc sử dụng các thuật toán nội suy phức tạp như KNN Imputer và MICE.

Đạo đức máy học, khả năng giải thích (XAI) và MLOps

Khi các thuật toán máy học thâm nhập sâu vào các quyết định sinh tử của đời sống xã hội (như cấp tín dụng ngân hàng, tuyển dụng nhân sự, chẩn đoán y tế và tư pháp hình sự), các yêu cầu về tính minh bạch, công bằng và khả năng giải thích trở nên cấp thiết:

Lĩnh vực Trí tuệ nhân tạo có thể giải thích (Explainable AI - XAI) phát triển các phương pháp như SHAP (Shapley Additive exPlanations) dựa trên lý thuyết trò chơi hợp tác và LIME (Local Interpretable Model-agnostic Explanations) để bóc tách đóng góp định lượng của từng thuộc tính đầu vào đối với từng dự đoán cụ thể của các mô hình hộp đen phức tạp.

Bên cạnh đó, chu trình kỹ nghệ học máy (MLOps - Machine Learning Operations) thiết lập các chuẩn mực tự động hóa tích hợp liên tục (CI/CD/CT) cho việc theo dõi độ lệch phân phối dữ liệu (data drift), độ suy giảm hiệu năng mô hình (concept drift), và tự động tái huấn luyện nhằm bảo đảm tính ổn định và an toàn của hệ thống máy học trong môi trường sản xuất thực tế.

Các kiến trúc học sâu tiên tiến: Từ CNN, RNN đến Transformer và Diffusion

Sự tiến hóa của học sâu đã làm thay đổi hoàn toàn cục diện nghiên cứu máy học trong thập kỷ qua thông qua các kiến trúc mạng nơ-ron chuyên biệt hóa cao:

  • Mạng nơ-ron tích chập (CNN): Khai thác tính bất biến tịnh tiến và cấu trúc không gian cục bộ thông qua các phép toán tích chập và lấy mẫu gộp (pooling), thống trị các tác vụ thị giác máy tính như nhận dạng ảnh và phân vùng đối tượng y tế.
  • Kiến trúc Transformer: Thay thế hoàn toàn các mạng hồi quy (RNN/LSTM) trong xử lý ngôn ngữ tự nhiên nhờ cơ chế tự chú ý (self-attention), cho phép tính toán song song hóa trên quy mô hàng tỷ tham số và nắm bắt các phụ thuộc tầm xa hoàn hảo trong dữ liệu chuỗi.
  • Mô hình khuếch tán (Diffusion Models): Đột phá mới nhất trong trí tuệ nhân tạo sinh (Generative AI), tạo ra các dữ liệu hình ảnh và âm thanh chân thực vượt bậc thông qua quá trình học cách đảo ngược sự khuếch tán nhiễu Gaussian ngẫu nhiên.

Câu hỏi thường gặp

Ba mô hình học tập cơ bản trong máy học gồm những gì?

Ba mô hình cơ bản là học có giám sát (supervised learning), học không giám sát (unsupervised learning) và học tăng cường (reinforcement learning).

Hiện tượng quá khớp (overfitting) là gì và làm thế nào để khắc phục?

Overfitting là hiện tượng mô hình ghi nhớ quá chi tiết nhiễu của tập dữ liệu huấn luyện khiến khả năng khái quát hóa trên dữ liệu mới bị kém; khắc phục bằng điều chuẩn (regularization), kiểm định chéo (cross-validation) hoặc bổ sung dữ liệu.

Sự khác biệt căn bản giữa máy học truyền thống và học sâu (deep learning) là gì?

Máy học truyền thống đòi hỏi bước trích xuất đặc trưng thủ công (feature engineering); trong khi học sâu tự động trích xuất các tầng đặc trưng trừu tượng thông qua các mạng nơ-ron nhiều lớp.

Tài liệu tham khảo

  1. Kumaravelan, Behera (2021). Deployment of Supervised Machine Learning and Deep Learning Algorithms in Biomedical Text Classification. Handbook of Artificial Intelligence in Biomedical Engineering. doi:10.1201/9781003045564-18 DOI: 10.1201/9781003045564-18
  2. Vermeulen (2019). Supervised Learning: Advanced Algorithms. Industrial Machine Learning. doi:10.1007/978-1-4842-5316-8_5 DOI: 10.1007/978-1-4842-5316-8_5
  3. Kumari, Mishra (2020). Deep Networks and Deep Learning Algorithms. Artificial Intelligence Trends for Data Analytics Using Machine Learning and Deep Learning Approaches. doi:10.1201/9780367854737-12 DOI: 10.1201/9780367854737-12