Từ điển học thuật Kỹ thuật và công nghệ

Phân đoạn là gì? Các bài báo nghiên cứu khoa học liên quan

Tiếng AnhSegmentation (image processing / computer vision)

quá trình phân chia hình ảnh số hoặc tín hiệu phức tạp thành nhiều phân vùng hoặc nhóm điểm ảnh có ý nghĩa ngữ nghĩa tương đồng nhằm đơn giản hóa việc phân tích và nhận dạng đối tượng tự động.

250 lượt xem Cập nhật 14/9/2026

Phân đoạn (Segmentation (image processing / computer vision)) là quá trình phân chia hình ảnh số hoặc tín hiệu phức tạp thành nhiều phân vùng hoặc nhóm điểm ảnh có ý nghĩa ngữ nghĩa tương đồng nhằm đơn giản hóa việc phân tích và nhận dạng đối tượng tự động.

Định nghĩa phân đoạn

Phân đoạn (segmentation) là quá trình chia một tập hợp dữ liệu (hình ảnh, tín hiệu, văn bản, chuỗi thời gian, v.v.) thành các phần nhỏ hơn — gọi là các phân đoạn — sao cho mỗi phân đoạn tương ứng với một vùng đồng nhất về đặc trưng hoặc ý nghĩa. Mục tiêu là biến đổi dữ liệu phức tạp thành các phần có ý nghĩa để phân tích, trích xuất thông tin hoặc xử lý tiếp theo dễ dàng hơn.

Trong lĩnh vực thị giác máy tính, phân đoạn hình ảnh (image segmentation) là kỹ thuật gán nhãn cho từng điểm ảnh (pixel) sao cho các pixel thuộc cùng phân đoạn chia sẻ đặc điểm như màu sắc, độ sáng, kết cấu hoặc vị trí không gian. Quá trình này giúp xác định vị trí, hình dạng và biên của các đối tượng trong ảnh.

Ngoài hình ảnh, khái niệm phân đoạn áp dụng cho tín hiệu (signal segmentation) khi tách sóng thành các đoạn có tính chất ổn định, phân đoạn văn bản (text segmentation) để tách từ, câu hoặc chủ đề, và phân đoạn thị trường (market segmentation) để chia nhóm khách hàng theo đặc tính. Mỗi loại phân đoạn đòi hỏi thuật toán và định nghĩa khác nhau phù hợp với tính chất dữ liệu.

Phân loại các phương pháp phân đoạn

Các phương pháp phân đoạn được chia theo nguyên lý hoạt động và loại dữ liệu xử lý. Có thể nhóm chung theo hai cách chủ yếu:

  • Phương pháp cổ điển (classical approaches): thresholding, phân cụm (clustering), vùng lan rộng (region growing), phát triển mô hình thống kê (statistical models)
  • Phương pháp học máy / mạng nơ-ron sâu (ML / deep learning): phân đoạn theo semantic, instance segmentation, mạng U‑Net, Mask R-CNN, v.v.

Cách khác để phân loại là theo mục tiêu:

  • Phân đoạn nhị phân (foreground / background segmentation)
  • Phân đoạn đa lớp (semantic segmentation)
  • Phân đoạn thực thể riêng biệt (instance segmentation)
  • Phân đoạn quang hợp (panoptic segmentation): kết hợp semantic + instance segmentation

Các thuật toán phân đoạn hình ảnh phổ biến

Một số thuật toán phân đoạn hình ảnh nhiều người biết đến bao gồm:

Thuật toánNguyên lý chínhƯu điểm / ứng dụng
ThresholdingSo sánh giá trị pixel với ngưỡngNhanh, đơn giản, phù hợp ảnh tĩnh đơn giản
WatershedDựa vào gradient như địa hìnhPhân tách vùng liên tục, phù hợp ảnh mô sinh học
k‑meansPhân cụm pixel theo đặc trưngHiệu quả với ảnh có vùng màu khác biệt rõ
GrabCutGraph cuts + mô hình hỗn hợp GaussianPhân nền / đối tượng tương tác (user-assisted)
U‑NetMạng encoder-decoder, học sâuPhân đoạn y tế, ảnh cao cấp, hiệu quả trong học sâu

Ngoài ra còn có các phương pháp như split‑and‑merge (chia và hợp) dựa trên việc chia ảnh thành vùng con rồi hợp các vùng tương đồng lại.

Cũng có các phương pháp phân đoạn theo đồ thị (graph-based), sử dụng cắt đồ thị (graph cuts), tối ưu năng lượng (energy minimization), hoặc mô hình biến phân (variational methods) để tìm biên phân đoạn tối ưu giữa dữ liệu và điều kiện trơn mịn.

Phân đoạn tín hiệu và chuỗi thời gian

Trong xử lý tín hiệu và chuỗi thời gian, phân đoạn nhằm tách tín hiệu thành các đoạn ổn định hoặc phát hiện điểm đổi trạng thái (change points). Ví dụ, trong điện tâm đồ (ECG), ta phân đoạn các sóng P, QRS, T để phân tích đặc điểm nhịp tim.

Các kỹ thuật thường dùng bao gồm:

  • Sliding window (cửa sổ trượt)
  • Change point detection (phát hiện điểm chuyển tiếp)
  • Hidden Markov Models (HMM)
  • Dynamic Time Warping (DTW) để so sánh mẫu chuỗi

Phân đoạn tín hiệu giúp xác định thời điểm xuất hiện sự kiện, bất thường hoặc đặc trưng riêng trong chuỗi đo, phục vụ các ứng dụng như phân tích ECG, giám sát máy móc (vibrations), hoặc dự báo thời tiết.

Đo lường hiệu suất của phân đoạn

Để đánh giá chất lượng kết quả phân đoạn, người ta sử dụng nhiều chỉ số so sánh giữa phân đoạn đề xuất và ground truth (nhãn chuẩn). Một số chỉ số phổ biến bao gồm Intersection over Union (IoU), Dice Coefficient (F1‑Score nhị phân tập trung vào vùng), precision, recall và các chỉ số như Adjusted Rand Index (ARI) khi phân đoạn nhiều lớp.

Công thức mẫu: IoU=SpredSgtSpredSgt,Dice=2SpredSgtSpred+Sgt \text{IoU} = \frac{|S_{\text{pred}} \cap S_{\text{gt}}|}{|S_{\text{pred}} \cup S_{\text{gt}}|}, \quad \text{Dice} = \frac{2|S_{\text{pred}} \cap S_{\text{gt}}|}{|S_{\text{pred}}| + |S_{\text{gt}}|} Trong đó Spred S_{\text{pred}} là tập pixel phân đoạn dự đoán, Sgt S_{\text{gt}} là tập pixel nhãn chuẩn. Precision và recall đo tỷ lệ pixel đúng thuộc lớp/nhãn mong đợi. ARI đo mức tương đồng giữa hai phân vùng bất kỳ.

Khi phân đoạn đa lớp hoặc phân đoạn thực thể (instance segmentation), còn có các chỉ số mở rộng như mean IoU (mIoU), Panoptic Quality (PQ) hoặc Fowlkes–Mallows index. Các benchmark lớn như Cityscapes, PASCAL VOC, COCO dùng mIoU và PQ làm tiêu chuẩn đánh giá các thuật toán segmentation hiện đại.

Ứng dụng thực tiễn của phân đoạn

Trong y tế, phân đoạn hình ảnh được ứng dụng rộng rãi để xác định cấu trúc mô, vùng tổn thương hoặc khối u trên ảnh CT, MRI, X‑ray. Phân đoạn chính xác giúp hỗ trợ phẫu thuật hướng dẫn, định lượng thể tích khối u và theo dõi điều trị. (Tham khảo các nghiên cứu segmentation y tế)

Trong thị giác máy tính và hệ thống nhúng, phân đoạn giúp phát hiện đối tượng, phân tách nền, hỗ trợ các nhiệm vụ như ô tô tự lái (tách làn đường, người, phương tiện), giám sát an ninh, thực tế tăng cường. Trong ảnh vệ tinh, phân đoạn giúp phân lớp đất, rừng, mặt nước, băng, đô thị.

Còn trong xử lý video, phân đoạn thời gian mở rộng sang “video segmentation” (phân đoạn từng khung và theo dõi đối tượng qua thời gian) hoặc “3D segmentation” để xử lý dữ liệu volumetric như ảnh y tế 3 chiều. Nhiều thuật toán học sâu kết hợp ngữ cảnh không gian–thời gian để cải thiện độ ổn định phân đoạn liên khung.

Thách thức và hướng phát triển mới

Một số thách thức lớn trong phân đoạn bao gồm:

  • Thiếu dữ liệu nhãn pixel chuẩn — việc gán nhãn pixel rất tốn thời gian
  • Chênh lệch giữa các lớp (class imbalance) — một số lớp chiếm số pixel rất ít dẫn đến mô hình thiên lệch
  • Độ phức tạp mô hình cao, yêu cầu nhiều tài nguyên tính toán, khó áp dụng trên thiết bị hạn chế
  • Khả năng tổng quát hóa yếu khi dữ liệu đánh giá khác phân phối so với dữ liệu huấn luyện

Xu hướng mới tập trung vào:

  • Phân đoạn “label-efficient” — dùng giám sát yếu, bán giám sát hoặc không giám sát để giảm nhu cầu nhãn pixel
  • Kiến trúc mạng chú ý (attention) và Transformer trong segmentation (không gian và thời gian)
  • Phương pháp lai (hybrid) kết hợp học sâu với thuật toán truyền thống để đạt độ ổn định và hiệu quả
  • Áp dụng mạng nhẹ, tối ưu hóa mô hình cho thiết bị biên (edge devices) và làm segmentation real-time

Kết luận

Phân đoạn là bước nền tảng trong nhiều hệ thống nhận thức và xử lý dữ liệu, từ hình ảnh y tế đến video và dữ liệu chuỗi. Với sự phát triển của học sâu và phương pháp giám sát yếu, phân đoạn ngày càng trở nên linh hoạt, hiệu quả và dễ áp dụng trong thực tế.

Kiến trúc học sâu tiên tiến trong phân đoạn ảnh y tế và thị giác máy tính

Bên cạnh các kiến trúc mạng tích chập kinh điển như U-Net và FCN, lĩnh vực phân đoạn ảnh số (image segmentation) đã chứng kiến sự bùng nổ của các mô hình học sâu hiện đại dựa trên cơ chế tự chú ý (self-attention mechanism) và mô hình thị giác nền tảng (foundation models). Điển hình là kiến trúc TransUNet, kết hợp sức mạnh trích xuất đặc trưng cục bộ của mạng tích chập CNN với khả năng nắm bắt ngữ cảnh toàn cục tầm xa của Vision Transformer (ViT), khắc phục triệt để hạn chế trường tiếp nhận hữu hạn của các lớp tích chập truyền thống trong phân đoạn tổn thương mô bệnh học phức tạp.

Đặc biệt, sự ra đời của mô hình nền tảng Segment Anything Model (SAM) của Meta AI đã thiết lập chuẩn mực mới cho phân đoạn ảnh tương tác không cần huấn luyện trước (zero-shot segmentation). SAM được huấn luyện trên tập dữ liệu khổng lồ SA-1B (hơn 11 triệu ảnh và 1 tỷ mặt nạ phân đoạn), cho phép phân đoạn chính xác bất kỳ đối tượng mục tiêu nào chỉ dựa trên các lời nhắc (prompts) trực quan linh hoạt như điểm chấm (points), khung hộp giới hạn (bounding boxes) hoặc văn bản mô tả tự nhiên. Trong phân tích ảnh viễn thám và chẩn đoán hình ảnh y khoa, các biến thể thích ứng như MedSAM đang giúp tự động hóa phân đoạn cơ quan giải phẫu và khối u với độ chính xác và tốc độ vượt trội.

Các thước đo đánh giá định lượng độ chính xác phân đoạn

Để lượng giá khách quan hiệu năng của thuật toán phân đoạn trên các bộ dữ liệu chuẩn (như COCO, Cityscapes hoặc Pascal VOC), các chỉ số toán học thống kê sau đây được sử dụng:

  • Mean Intersection over Union (mIoU): Thước đo tiêu chuẩn vàng trong phân đoạn ngữ nghĩa, tính bằng trung bình cộng tỷ lệ diện tích phần giao trên diện tích phần hợp giữa mặt nạ dự đoán (P) và mặt nạ chuẩn thực tế (G) trên toàn bộ các lớp đối tượng:

    mIoU=1Cc=1CPcGcPcGc=1Cc=1CTPcTPc+FPc+FNc\text{mIoU} = \frac{1}{C} \sum_{c=1}^{C} \frac{|P_c \cap G_c|}{|P_c \cup G_c|} = \frac{1}{C} \sum_{c=1}^{C} \frac{\text{TP}_c}{\text{TP}_c + \text{FP}_c + \text{FN}_c}

    trong đó CC là tổng số lớp đối tượng, TPc,FPc,FNc\text{TP}_c, \text{FP}_c, \text{FN}_c lần lượt là số lượng điểm ảnh dương tính thật, dương tính giả và âm tính giả của lớp cc.
  • Hệ số tương đồng Dice (Dice Similarity Coefficient - DSC): Rất phổ biến trong phân đoạn ảnh y tế do độ nhạy cao với sự mất cân bằng giữa vùng tổn thương nhỏ và nền ảnh lớn:

    Dice=2PGP+G=2TP2TP+FP+FN\text{Dice} = \frac{2 |P \cap G|}{|P| + |G|} = \frac{2 \cdot \text{TP}}{2 \cdot \text{TP} + \text{FP} + \text{FN}}

    Mối quan hệ trực tiếp giữa hai đại lượng được xác lập qua công thức Dice=2IoU1+IoU\text{Dice} = \frac{2 \cdot \text{IoU}}{1 + \text{IoU}}.
  • Khoảng cách Hausdorff 95% (HD95): Đo lường sai số tối đa giữa các điểm biên của bề mặt dự đoán và bề mặt thực tế ở phân vị thứ 95 nhằm loại bỏ ảnh hưởng của các điểm ngoại lai, phản ánh độ khít khao của ranh giới phân đoạn trong can thiệp xạ trị hoặc phẫu thuật có định vị.

Câu hỏi thường gặp

Sự khác biệt giữa phân đoạn ngữ nghĩa (semantic segmentation) và phân đoạn cá thể (instance segmentation)?

Phân đoạn ngữ nghĩa gán nhãn lớp cho từng pixel nhưng không phân biệt các cá thể riêng biệt trong cùng một lớp (ví dụ: tất cả pixel thuộc người được gán cùng nhãn); trong khi phân đoạn cá thể vừa xác định nhãn lớp vừa tách biệt ranh giới chính xác của từng cá thể riêng rẽ.

Kiến trúc mạng nơ-ron tích chập U-Net đóng vai trò then chốt như thế nào trong phân đoạn ảnh y tế?

U-Net gồm nhánh mã hóa (contracting path) giúp nắm bắt ngữ cảnh trừu tượng và nhánh giải mã đối xứng (expanding path) giúp định vị không gian chính xác, kết hợp các kết nối tắt (skip connections) truyền trực tiếp các đặc trưng không gian chi tiết từ nhánh mã hóa sang giải mã.

Chỉ số IoU (Intersection over Union) và Dice Coefficient đo lường độ chính xác phân đoạn như thế nào?

Cả hai chỉ số đều đo độ tương đồng giữa mặt nạ dự đoán và mặt nạ thực tế (ground truth): IoU là tỷ lệ diện tích giao trên diện tích hợp của hai tập hợp; Dice bằng 2 lần diện tích giao chia cho tổng diện tích của hai tập hợp (Dice = 2*IoU / (1 + IoU)).

Tài liệu tham khảo

  1. Imaduddin, Sigit, Risnumawan (2021). Multidimensional Echocardiography Image Segmentation using Deep Learning Convolutional Neural Network. Proceedings of the 4th International Conference on Applied Science and Technology on Engineering Science. DOI: 10.5220/0010963200003260
  2. Parvez (2022). Deep Learning Model for Image Classification Using Convolutional Neural Network. International Journal of Science and Research (IJSR). DOI: 10.21275/sr22731164616
  3. Das, Sarkar, Das (2025). Real-Time Detection of Meningiomas by Image Segmentation: A Very Deep Transfer Learning Convolutional Neural Network Approach. MDPI AG. DOI: 10.20944/preprints202503.0492.v1