Phân loại hình ảnh (image classification) là một trong những bài toán cốt lõi và nền tảng nhất của lĩnh vực thị giác máy tính (computer vision) và trí tuệ nhân tạo. Mục tiêu của bài toán là tiếp nhận một hình ảnh số đầu vào và dự đoán nhãn danh mục tương ứng từ một tập hợp các lớp định trước .
Phát biểu bài toán Toán học
Cho một không gian hình ảnh đầu vào, mô hình phân loại học một hàm ánh xạ tham số hóa để dự đoán phân phối xác suất có điều kiện trên tập các nhãn lớp . Quyết định phân loại được xác định bằng công thức cực đại hóa xác suất hậu nghiệm:
Trong bài toán phân loại đơn nhãn đa lớp, đầu ra mong muốn thường được biểu diễn dưới dạng vector , trong đó chỉ có một phần tử bằng một đại diện cho lớp chính xác.
Tiến trình phát triển Phương pháp luận
Lịch sử phát triển của phân loại hình ảnh trải qua hai giai đoạn công nghệ mang tính bước ngoặt:
- Phương pháp trích xuất đặc trưng thủ công: Trước kỷ nguyên học sâu, các hệ thống thị giác dựa trên các thuật toán trích xuất đặc trưng biểu diễn như SIFT, SURF hoặc HOG, kết hợp với các bộ phân loại máy học cổ điển như Support Vector Machines hoặc Random Forest.
- Kỷ nguyên mạng nơ-ron tích chập sâu: Bước đột phá xuất hiện khi Krizhevsky và cộng sự (2017) công bố mạng AlexNet đạt thành tích vượt trội tại cuộc thi ImageNet. Mạng CNN tự động học biểu diễn đặc trưng phân tầng từ dữ liệu thô, mở ra thời kỳ bùng nổ của học sâu theo tổng quan của LeCun, Bengio và Hinton (2015).
- Kiến trúc Mạng nơ-ron dư: He và cộng sự (2016) đề xuất mạng ResNet giới thiệu các kết nối tắt, giải quyết triệt để vấn đề tiêu biến đạo hàm và cho phép huấn luyện các mạng nơ-ron có độ sâu hàng trăm lớp.
Các kiến trúc mô hình Phổ biến
| Kiến trúc mạng | Cơ chế cốt lõi | Ưu điểm nổi bật |
|---|---|---|
| AlexNet, VGGNet | Xếp chồng các lớp tích chập chuẩn và hàm kích hoạt phi tuyến | Cấu trúc tuần tự trực quan, dễ cài đặt |
| ResNet | Học phần dư qua các khối kết nối tắt | Huấn luyện ổn định các mạng sâu, độ chính xác cao |
| Vision Transformer (ViT) | Chia ảnh thành patches và áp dụng cơ chế tự chú ý | Khai thác phụ thuộc toàn cục, hiệu quả vượt trội khi có dữ liệu khổng lồ |
| MobileNet, EfficientNet | Tích chập tách biệt theo chiều sâu và chuẩn hóa tỷ lệ | Kích thước nhỏ gọn, tối ưu hóa chạy thời gian thực trên thiết bị di động |
Quy trình Huấn luyện và Kỹ thuật Học chuyển giao
Quá trình xây dựng hệ thống phân loại ảnh hiện đại thường ứng dụng kỹ thuật Học chuyển giao. Mô hình được tiền huấn luyện trên các tập dữ liệu quy mô lớn, sau đó được tinh chỉnh trên tập dữ liệu đặc thù của bài toán mục tiêu. Các kỹ thuật tăng cường dữ liệu hình ảnh như xoay, lật, cắt ngẫu nhiên và biến đổi màu sắc được áp dụng để tăng cường tính tổng quát hóa của mô hình.
Ứng dụng thực tế và Triển khai tại Việt Nam
Phân loại hình ảnh được ứng dụng rộng rãi trong nhiều lĩnh vực công nghệ cao:
- Y tế thông minh: Phân loại hình ảnh X-quang phổi, cắt lớp vi tính, cộng hưởng từ và giải phẫu bệnh học hỗ trợ bác sĩ chẩn đoán khối u sớm.
- Giao thông thông minh: Nhận dạng biển số xe, phân loại phương tiện giao thông và giám sát vi phạm trật tự an toàn giao thông.
- Nông nghiệp công nghệ cao: Nhận diện các loại sâu bệnh trên lá cây trồng qua ảnh chụp điện thoại thông minh phục vụ canh tác chính xác.
- Thương mại điện tử: Tự động phân loại và gắn nhãn sản phẩm theo hình ảnh người dùng tải lên.
Thách thức và Giới hạn công nghệ
Mặc dù đạt độ chính xác cao, các mô hình phân loại hình ảnh vẫn đối mặt với những rào cản:
- Tính dễ bị tấn công đối kháng, trong đó những nhiễu nhỏ mắt thường không thấy được có thể khiến mô hình dự đoán sai hoàn toàn.
- Sự phụ thuộc vào lượng lớn dữ liệu gán nhãn thủ công chất lượng cao.
- Hiện tượng sai lệch dữ liệu khi môi trường thực tế khác biệt so với tập dữ liệu huấn luyện.