Từ điển học thuật Kỹ thuật và công nghệ

Thị giác máy tính là gì? Các công bố khoa học về Thị giác máy tính

là một phân ngành của trí tuệ nhân tạo tập trung vào việc phát triển các thuật toán và hệ thống giúp máy tính thu nhận, xử lý, phân tích và diễn giải thông tin ý nghĩa từ hình ảnh hoặc video kỹ thuật số.

327 lượt xem Cập nhật 13/9/2026

{"ops":[{"insert":"Thị giác máy tính là một lĩnh vực của trí tuệ nhân tạo và công nghệ máy tính liên quan đến việc phát triển các hệ thống và chương trình máy tính để giúp máy tính nhận diện và hiểu các hình ảnh và video tương tự như con người. Thị giác máy tính sử dụng các thuật toán và kỹ thuật như: xử lý ảnh, mạng neural nhân tạo, khai phá dữ liệu và học máy để phân tích và rút trích thông tin từ hình ảnh, nhận dạng đối tượng, phát hiện hình ảnh, theo dõi vật thể và các tác vụ khác liên quan đến thị giác. Ứng dụng của thị giác máy tính có thể thấy trong các lĩnh vực như xe tự hành, nhận dạng khuôn mặt, quét mã vạch, chẩn đoán y tế và công nghiệp sản xuất.\nThị giác máy tính sử dụng các phương pháp và công nghệ để xử lý, phân tích và nhận diện hình ảnh và video. Dưới đây là một số khái niệm chính trong lĩnh vực này:\n\n1. Xử lý ảnh: Thị giác máy tính sử dụng các thuật toán để biến đổi và xử lý các hình ảnh kỹ thuật số. Các công cụ xử lý ảnh bao gồm lọc, biến đổi hình học, biến đổi màu sắc và phân đoạn ảnh.\n\n2. Nhận dạng đối tượng: Một trong những nhiệm vụ quan trọng của thị giác máy tính là nhận dạng đối tượng trong hình ảnh. Các thuật toán và mô hình học máy được sử dụng để tìm kiếm và phân loại các đối tượng như người, xe hơi, động vật, vật thể, v.v.\n\n3. Phát hiện hình ảnh: Thị giác máy tính có thể được sử dụng để phát hiện vị trí và tự động xác định các đối tượng trong hình ảnh. Các phương pháp như phát hiện ranh giới, phát hiện biên, phát hiện điểm đặc trưng và phát hiện các hình dạng có thể được áp dụng.\n\n4. Theo dõi vật thể: Thị giác máy tính có thể theo dõi vật thể theo thời gian trong các video hoặc chuỗi hình ảnh. Các thuật toán theo dõi đối tượng sử dụng các thông tin về vị trí, hướng, đặc điểm và sự thay đổi của vật thể trong các khung hình liên tiếp.\n\n5. Khai phá dữ liệu: Thị giác máy tính có thể khai thác thông tin từ tập dữ liệu hình ảnh và video để tạo ra kiến thức và hiểu biết. Các phương pháp khai phá dữ liệu bao gồm phân tích vùng, phân loại, nhận dạng mẫu và học máy.\n\nỨng dụng của thị giác máy tính rất đa dạng và có thể thấy trong nhiều lĩnh vực như giao thông vận tải (xe tự lái), kho bãi tự động, nhận dạng khuôn mặt, chẩn đoán y tế, kiểm tra chất lượng sản phẩm trong công nghiệp sản xuất, ứng dụng an ninh và quản lý, và nhiều lĩnh vực khác.\n"}]}

Quy trình tiền xử lý và trích xuất đặc trưng kinh điển

thị giác máy tính (Computer Vision) là một phân ngành của trí tuệ nhân tạo tập trung vào việc phát triển các thuật toán và hệ thống giúp máy tính thu nhận, xử lý, phân tích và diễn giải thông tin ý nghĩa từ hình ảnh hoặc video kỹ thuật số.

Các toán tử phát hiện biên cạnh kinh điển như Sobel, Prewitt và đặc biệt là giải thuật Canny sử dụng đạo hàm không gian bậc một và bậc hai để xác định các điểm có sự thay đổi đột ngột về cường độ sáng. Trên cơ sở đó, các bộ mô tả đặc trưng cục bộ bất biến với phép biến đổi tỷ lệ, xoay và thay đổi góc nhìn như SIFT (Scale-Invariant Feature Transform), SURF (Speeded-Up Robust Features) và HOG (Histogram of Oriented Gradients) đã tạo nên bước ngoặt lớn trong các bài toán nhận dạng khuôn mặt và phát hiện người đi bộ.

Các kiến trúc học sâu đột phá trong thị giác máy tính

Cuộc cách mạng học sâu (Deep Learning) khởi đầu với AlexNet (2012) đã thay đổi hoàn toàn cục diện nghiên cứu, biến các mạng nơ-ron tích chập (CNN) thành tiêu chuẩn thống trị. Các kiến trúc kế tiếp liên tục khắc phục hiện tượng suy biến gradient khi tăng độ sâu mạng: VGG sử dụng các bộ lọc tích chập nhỏ 3x3 xếp chồng; Inception áp dụng các khối tích chập đa quy mô song song; ResNet (Residual Networks) đưa ra bước nhảy tắt (skip connection) mang tính cách mạng cho phép huấn luyện thành công các mạng sâu hàng trăm tầng.

Đối with bài toán phát hiện vật thể, các kiến trúc được chia làm hai trường phái: mô hình hai giai đoạn (Two-stage) như R-CNN, Fast R-CNN, Faster R-CNN tập trung vào độ chính xác cao bằng cách đề xuất vùng ứng viên trước khi phân loại; và mô hình một giai đoạn (One-stage) như YOLO (You Only Look Once), SSD (Single Shot MultiBox Detector) tối ưu hóa tốc độ xử lý đạt ngưỡng thời gian thực (Real-time). Trong bài toán phân vùng ngữ nghĩa và phân vùng cá thể, các mạng kiến trúc hình chữ U như U-Net và Mask R-CNN giữ vai trò chủ chốt trong phân tích ảnh y tế và thị giác xe tự hành.

Xu hướng Vision Transformer và các thách thức nghiên cứu mở

Sự xuất hiện của Vision Transformer (ViT) và các biến thể phân cấp như Swin Transformer đã chứng minh rằng cơ chế tự chú ý (Self-Attention) có thể thay thế hiệu quả các phép tích chập cục bộ, nắm bắt mối quan hệ không gian toàn cục giữa các thành phần của bức ảnh với độ khái quát hóa rất cao trên các tập dữ liệu khổng lồ. Đồng thời, các mô hình nền tảng đa phương thức (Vision-Language Models như CLIP, SAM - Segment Anything Model) đang mở ra kỷ nguyên nhận dạng không cần mẫu học trước (Zero-shot recognition).

Mặc dù đạt được những thành tựu vượt bậc, lĩnh vực thị giác máy tính vẫn đang đối mặt với các thách thức lớn: tính dễ bị tổn thương trước các tấn công đối nghịch (Adversarial Attacks) khi chỉ thay đổi một vài pixel không nhìn thấy bằng mắt thường; hiện tượng sụt giảm hiệu năng khi triển khai thực tế do lệch miền dữ liệu (Domain Shift); đòi hỏi tài nguyên tính toán phần cứng cực lớn; và nhu cầu cấp thiết về khả năng giải thích được (Explainable AI - XAI) trong các ứng dụng mang tính sinh tử như phẫu thuật có robot hỗ trợ và xe tự lái hoàn toàn.

Mô hình sinh hình ảnh đối nghịch và mô hình khuếch tán

Bên cạnh các tác vụ phân tích và hiểu ảnh, thị giác máy tính hiện đại đã đạt được những bước tiến vượt bậc trong lĩnh vực thị giác tạo sinh (Generative Computer Vision). Mạng sinh đối nghịch (Generative Adversarial Networks - GANs), do Ian Goodfellow đề xuất năm 2014, gồm hai mạng nơ-ron đối kháng: mạng sinh (Generator) tạo ra các bức ảnh giả và mạng phân biệt (Discriminator) cố gắng phân biệt ảnh thật và ảnh giả. Cuộc cạnh tranh đối kháng này thúc đẩy mạng sinh tạo ra các bức ảnh có độ chân thực hiển vi, ứng dụng trong tăng cường dữ liệu huấn luyện, siêu phân giải ảnh (Super-resolution) và phục hồi ảnh hỏng.

Trong những năm gần đây, các mô hình khuếch tán (Diffusion Models như DDPM, Stable Diffusion) đã vượt qua GAN về chất lượng tạo ảnh và độ ổn định khi huấn luyện. Bằng cách mô hình hóa quá trình khuếch tán nhiệt động học đảo ngược (thêm nhiễu Gauss từng bước vào ảnh và học cách khử nhiễu tuần tự), các mô hình khuếch tán cho phép tạo ra các hình ảnh nghệ thuật và ảnh y tế 3D phức tạp từ mô tả văn bản với độ chi tiết phi thường. Các tiêu chí định lượng chuẩn mực như khoảng cách khởi tạo Fréchet (Fréchet Inception Distance - FID) và độ tương đồng cấu trúc (SSIM) được sử dụng để đánh giá nghiêm ngặt chất lượng ảnh sinh ra.

Ứng dụng thực tiễn trong y tế và giao thông thông minh

Trong y tế kỹ thuật số, thị giác máy tính hỗ trợ đắc lực các bác sĩ chẩn đoán hình ảnh thông qua hệ thống chẩn đoán có máy tính hỗ trợ (CAD). Các mô hình phân vùng tự động cấu trúc giải phẫu trên ảnh cắt lớp CT và cộng hưởng từ MRI cho phép phát hiện sớm các nốt mờ ung thư phổi kích thước dưới 3 mm, tầm soát tổn thương võng mạc đái tháo đường và tự động hóa đo đạc phân suất tống máu tim. Trong giao thông thông minh và xe tự hành cấp độ 4, hệ thống thị giác lập thể (Stereo Vision) kết hợp cảm biến LiDAR thực hiện phát hiện chướng ngại vật, nhận diện biển báo và ước lượng quỹ đạo chuyển động của người đi bộ với độ trễ dưới 10 mili-giây.

Câu hỏi thường gặp

Sự khác biệt cốt lõi giữa phân loại ảnh, phát hiện vật thể và phân vùng ngữ nghĩa là gì?

Phân loại ảnh (Image Classification) gán một nhãn danh mục cho toàn bộ bức ảnh; Phát hiện vật thể (Object Detection) xác định nhãn cùng vị trí cụ thể của từng thực thể bằng hộp giới hạn (bounding box); trong khi Phân vùng ngữ nghĩa (Semantic Segmentation) phân loại nhãn chính xác đến từng pixel riêng lẻ trong bức ảnh.

Mạng nơ-ron tích chập (CNN) đóng vai trò như thế nào trong thị giác máy tính hiện đại?

Mạng CNN tự động học các biểu diễn không gian phân cấp của hình ảnh thông qua các lớp tích chập (convolutional layers) với các bộ lọc học được: từ các đặc trưng biên cạnh cấp thấp ở các lớp đầu tiên, đến hình dạng cục bộ ở lớp giữa, và các mẫu vật thể phức tạp cấp cao ở các lớp sâu, thay thế hoàn toàn kỹ thuật trích xuất đặc trưng thủ công truyền thống.

Kiến trúc Vision Transformer (ViT) khác biệt như thế nào so với CNN truyền thống?

Thay vì dựa trên phép tích chập cục bộ như CNN, Vision Transformer chia nhỏ hình ảnh thành chuỗi các mảng điểm ảnh (patches) tương tự như token từ trong NLP và áp dụng cơ chế tự chú ý (self-attention) để nắm bắt các phụ thuộc tầm xa toàn cục trên toàn bộ bức ảnh ngay từ các tầng đầu tiên, cho hiệu quả vượt trội khi được huấn luyện trên các tập dữ liệu quy mô lớn.

Tài liệu tham khảo

  1. Li, Ma, Sajid et al. (2020). Object Detection with Convolutional Neural Networks. Deep Learning in Computer Vision. DOI: 10.1201/9781351003827-2
  2. Uzhhorod National University, Nemesh (2025). DEEP LEARNING BASED ON CONVOLUTIONAL NEURAL NETWORKS FOR OBJECT DETECTION. Human and Space. DOI: 10.62717/2221-4550-2025-1-021
  3. Michelucci (2019). Fundamentals of Convolutional Neural Networks. Advanced Applied Deep Learning. DOI: 10.1007/978-1-4842-4976-5_3