Quy trình tiền xử lý và trích xuất đặc trưng kinh điển
thị giác máy tính (Computer Vision) là một phân ngành của trí tuệ nhân tạo tập trung vào việc phát triển các thuật toán và hệ thống giúp máy tính thu nhận, xử lý, phân tích và diễn giải thông tin ý nghĩa từ hình ảnh hoặc video kỹ thuật số.
Các toán tử phát hiện biên cạnh kinh điển như Sobel, Prewitt và đặc biệt là giải thuật Canny sử dụng đạo hàm không gian bậc một và bậc hai để xác định các điểm có sự thay đổi đột ngột về cường độ sáng. Trên cơ sở đó, các bộ mô tả đặc trưng cục bộ bất biến với phép biến đổi tỷ lệ, xoay và thay đổi góc nhìn như SIFT (Scale-Invariant Feature Transform), SURF (Speeded-Up Robust Features) và HOG (Histogram of Oriented Gradients) đã tạo nên bước ngoặt lớn trong các bài toán nhận dạng khuôn mặt và phát hiện người đi bộ.
Các kiến trúc học sâu đột phá trong thị giác máy tính
Cuộc cách mạng học sâu (Deep Learning) khởi đầu với AlexNet (2012) đã thay đổi hoàn toàn cục diện nghiên cứu, biến các mạng nơ-ron tích chập (CNN) thành tiêu chuẩn thống trị. Các kiến trúc kế tiếp liên tục khắc phục hiện tượng suy biến gradient khi tăng độ sâu mạng: VGG sử dụng các bộ lọc tích chập nhỏ 3x3 xếp chồng; Inception áp dụng các khối tích chập đa quy mô song song; ResNet (Residual Networks) đưa ra bước nhảy tắt (skip connection) mang tính cách mạng cho phép huấn luyện thành công các mạng sâu hàng trăm tầng.
Đối with bài toán phát hiện vật thể, các kiến trúc được chia làm hai trường phái: mô hình hai giai đoạn (Two-stage) như R-CNN, Fast R-CNN, Faster R-CNN tập trung vào độ chính xác cao bằng cách đề xuất vùng ứng viên trước khi phân loại; và mô hình một giai đoạn (One-stage) như YOLO (You Only Look Once), SSD (Single Shot MultiBox Detector) tối ưu hóa tốc độ xử lý đạt ngưỡng thời gian thực (Real-time). Trong bài toán phân vùng ngữ nghĩa và phân vùng cá thể, các mạng kiến trúc hình chữ U như U-Net và Mask R-CNN giữ vai trò chủ chốt trong phân tích ảnh y tế và thị giác xe tự hành.
Xu hướng Vision Transformer và các thách thức nghiên cứu mở
Sự xuất hiện của Vision Transformer (ViT) và các biến thể phân cấp như Swin Transformer đã chứng minh rằng cơ chế tự chú ý (Self-Attention) có thể thay thế hiệu quả các phép tích chập cục bộ, nắm bắt mối quan hệ không gian toàn cục giữa các thành phần của bức ảnh với độ khái quát hóa rất cao trên các tập dữ liệu khổng lồ. Đồng thời, các mô hình nền tảng đa phương thức (Vision-Language Models như CLIP, SAM - Segment Anything Model) đang mở ra kỷ nguyên nhận dạng không cần mẫu học trước (Zero-shot recognition).
Mặc dù đạt được những thành tựu vượt bậc, lĩnh vực thị giác máy tính vẫn đang đối mặt với các thách thức lớn: tính dễ bị tổn thương trước các tấn công đối nghịch (Adversarial Attacks) khi chỉ thay đổi một vài pixel không nhìn thấy bằng mắt thường; hiện tượng sụt giảm hiệu năng khi triển khai thực tế do lệch miền dữ liệu (Domain Shift); đòi hỏi tài nguyên tính toán phần cứng cực lớn; và nhu cầu cấp thiết về khả năng giải thích được (Explainable AI - XAI) trong các ứng dụng mang tính sinh tử như phẫu thuật có robot hỗ trợ và xe tự lái hoàn toàn.
Mô hình sinh hình ảnh đối nghịch và mô hình khuếch tán
Bên cạnh các tác vụ phân tích và hiểu ảnh, thị giác máy tính hiện đại đã đạt được những bước tiến vượt bậc trong lĩnh vực thị giác tạo sinh (Generative Computer Vision). Mạng sinh đối nghịch (Generative Adversarial Networks - GANs), do Ian Goodfellow đề xuất năm 2014, gồm hai mạng nơ-ron đối kháng: mạng sinh (Generator) tạo ra các bức ảnh giả và mạng phân biệt (Discriminator) cố gắng phân biệt ảnh thật và ảnh giả. Cuộc cạnh tranh đối kháng này thúc đẩy mạng sinh tạo ra các bức ảnh có độ chân thực hiển vi, ứng dụng trong tăng cường dữ liệu huấn luyện, siêu phân giải ảnh (Super-resolution) và phục hồi ảnh hỏng.
Trong những năm gần đây, các mô hình khuếch tán (Diffusion Models như DDPM, Stable Diffusion) đã vượt qua GAN về chất lượng tạo ảnh và độ ổn định khi huấn luyện. Bằng cách mô hình hóa quá trình khuếch tán nhiệt động học đảo ngược (thêm nhiễu Gauss từng bước vào ảnh và học cách khử nhiễu tuần tự), các mô hình khuếch tán cho phép tạo ra các hình ảnh nghệ thuật và ảnh y tế 3D phức tạp từ mô tả văn bản với độ chi tiết phi thường. Các tiêu chí định lượng chuẩn mực như khoảng cách khởi tạo Fréchet (Fréchet Inception Distance - FID) và độ tương đồng cấu trúc (SSIM) được sử dụng để đánh giá nghiêm ngặt chất lượng ảnh sinh ra.
Ứng dụng thực tiễn trong y tế và giao thông thông minh
Trong y tế kỹ thuật số, thị giác máy tính hỗ trợ đắc lực các bác sĩ chẩn đoán hình ảnh thông qua hệ thống chẩn đoán có máy tính hỗ trợ (CAD). Các mô hình phân vùng tự động cấu trúc giải phẫu trên ảnh cắt lớp CT và cộng hưởng từ MRI cho phép phát hiện sớm các nốt mờ ung thư phổi kích thước dưới 3 mm, tầm soát tổn thương võng mạc đái tháo đường và tự động hóa đo đạc phân suất tống máu tim. Trong giao thông thông minh và xe tự hành cấp độ 4, hệ thống thị giác lập thể (Stereo Vision) kết hợp cảm biến LiDAR thực hiện phát hiện chướng ngại vật, nhận diện biển báo và ước lượng quỹ đạo chuyển động của người đi bộ với độ trễ dưới 10 mili-giây.