Phân đoạn (Segmentation (image processing / computer vision)) là quá trình phân chia hình ảnh số hoặc tín hiệu phức tạp thành nhiều phân vùng hoặc nhóm điểm ảnh có ý nghĩa ngữ nghĩa tương đồng nhằm đơn giản hóa việc phân tích và nhận dạng đối tượng tự động.
Định nghĩa phân đoạn
Phân đoạn (segmentation) là quá trình chia một tập hợp dữ liệu (hình ảnh, tín hiệu, văn bản, chuỗi thời gian, v.v.) thành các phần nhỏ hơn — gọi là các phân đoạn — sao cho mỗi phân đoạn tương ứng với một vùng đồng nhất về đặc trưng hoặc ý nghĩa. Mục tiêu là biến đổi dữ liệu phức tạp thành các phần có ý nghĩa để phân tích, trích xuất thông tin hoặc xử lý tiếp theo dễ dàng hơn.
Trong lĩnh vực thị giác máy tính, phân đoạn hình ảnh (image segmentation) là kỹ thuật gán nhãn cho từng điểm ảnh (pixel) sao cho các pixel thuộc cùng phân đoạn chia sẻ đặc điểm như màu sắc, độ sáng, kết cấu hoặc vị trí không gian. Quá trình này giúp xác định vị trí, hình dạng và biên của các đối tượng trong ảnh.
Ngoài hình ảnh, khái niệm phân đoạn áp dụng cho tín hiệu (signal segmentation) khi tách sóng thành các đoạn có tính chất ổn định, phân đoạn văn bản (text segmentation) để tách từ, câu hoặc chủ đề, và phân đoạn thị trường (market segmentation) để chia nhóm khách hàng theo đặc tính. Mỗi loại phân đoạn đòi hỏi thuật toán và định nghĩa khác nhau phù hợp với tính chất dữ liệu.
Phân loại các phương pháp phân đoạn
Các phương pháp phân đoạn được chia theo nguyên lý hoạt động và loại dữ liệu xử lý. Có thể nhóm chung theo hai cách chủ yếu:
- Phương pháp cổ điển (classical approaches): thresholding, phân cụm (clustering), vùng lan rộng (region growing), phát triển mô hình thống kê (statistical models)
- Phương pháp học máy / mạng nơ-ron sâu (ML / deep learning): phân đoạn theo semantic, instance segmentation, mạng U‑Net, Mask R-CNN, v.v.
Cách khác để phân loại là theo mục tiêu:
- Phân đoạn nhị phân (foreground / background segmentation)
- Phân đoạn đa lớp (semantic segmentation)
- Phân đoạn thực thể riêng biệt (instance segmentation)
- Phân đoạn quang hợp (panoptic segmentation): kết hợp semantic + instance segmentation
Các thuật toán phân đoạn hình ảnh phổ biến
Một số thuật toán phân đoạn hình ảnh nhiều người biết đến bao gồm:
| Thuật toán | Nguyên lý chính | Ưu điểm / ứng dụng |
|---|---|---|
| Thresholding | So sánh giá trị pixel với ngưỡng | Nhanh, đơn giản, phù hợp ảnh tĩnh đơn giản |
| Watershed | Dựa vào gradient như địa hình | Phân tách vùng liên tục, phù hợp ảnh mô sinh học |
| k‑means | Phân cụm pixel theo đặc trưng | Hiệu quả với ảnh có vùng màu khác biệt rõ |
| GrabCut | Graph cuts + mô hình hỗn hợp Gaussian | Phân nền / đối tượng tương tác (user-assisted) |
| U‑Net | Mạng encoder-decoder, học sâu | Phân đoạn y tế, ảnh cao cấp, hiệu quả trong học sâu |
Ngoài ra còn có các phương pháp như split‑and‑merge (chia và hợp) dựa trên việc chia ảnh thành vùng con rồi hợp các vùng tương đồng lại.
Cũng có các phương pháp phân đoạn theo đồ thị (graph-based), sử dụng cắt đồ thị (graph cuts), tối ưu năng lượng (energy minimization), hoặc mô hình biến phân (variational methods) để tìm biên phân đoạn tối ưu giữa dữ liệu và điều kiện trơn mịn.
Phân đoạn tín hiệu và chuỗi thời gian
Trong xử lý tín hiệu và chuỗi thời gian, phân đoạn nhằm tách tín hiệu thành các đoạn ổn định hoặc phát hiện điểm đổi trạng thái (change points). Ví dụ, trong điện tâm đồ (ECG), ta phân đoạn các sóng P, QRS, T để phân tích đặc điểm nhịp tim.
Các kỹ thuật thường dùng bao gồm:
- Sliding window (cửa sổ trượt)
- Change point detection (phát hiện điểm chuyển tiếp)
- Hidden Markov Models (HMM)
- Dynamic Time Warping (DTW) để so sánh mẫu chuỗi
Phân đoạn tín hiệu giúp xác định thời điểm xuất hiện sự kiện, bất thường hoặc đặc trưng riêng trong chuỗi đo, phục vụ các ứng dụng như phân tích ECG, giám sát máy móc (vibrations), hoặc dự báo thời tiết.
Đo lường hiệu suất của phân đoạn
Để đánh giá chất lượng kết quả phân đoạn, người ta sử dụng nhiều chỉ số so sánh giữa phân đoạn đề xuất và ground truth (nhãn chuẩn). Một số chỉ số phổ biến bao gồm Intersection over Union (IoU), Dice Coefficient (F1‑Score nhị phân tập trung vào vùng), precision, recall và các chỉ số như Adjusted Rand Index (ARI) khi phân đoạn nhiều lớp.
Công thức mẫu: Trong đó là tập pixel phân đoạn dự đoán, là tập pixel nhãn chuẩn. Precision và recall đo tỷ lệ pixel đúng thuộc lớp/nhãn mong đợi. ARI đo mức tương đồng giữa hai phân vùng bất kỳ.
Khi phân đoạn đa lớp hoặc phân đoạn thực thể (instance segmentation), còn có các chỉ số mở rộng như mean IoU (mIoU), Panoptic Quality (PQ) hoặc Fowlkes–Mallows index. Các benchmark lớn như Cityscapes, PASCAL VOC, COCO dùng mIoU và PQ làm tiêu chuẩn đánh giá các thuật toán segmentation hiện đại.
Ứng dụng thực tiễn của phân đoạn
Trong y tế, phân đoạn hình ảnh được ứng dụng rộng rãi để xác định cấu trúc mô, vùng tổn thương hoặc khối u trên ảnh CT, MRI, X‑ray. Phân đoạn chính xác giúp hỗ trợ phẫu thuật hướng dẫn, định lượng thể tích khối u và theo dõi điều trị. (Tham khảo các nghiên cứu segmentation y tế)
Trong thị giác máy tính và hệ thống nhúng, phân đoạn giúp phát hiện đối tượng, phân tách nền, hỗ trợ các nhiệm vụ như ô tô tự lái (tách làn đường, người, phương tiện), giám sát an ninh, thực tế tăng cường. Trong ảnh vệ tinh, phân đoạn giúp phân lớp đất, rừng, mặt nước, băng, đô thị.
Còn trong xử lý video, phân đoạn thời gian mở rộng sang “video segmentation” (phân đoạn từng khung và theo dõi đối tượng qua thời gian) hoặc “3D segmentation” để xử lý dữ liệu volumetric như ảnh y tế 3 chiều. Nhiều thuật toán học sâu kết hợp ngữ cảnh không gian–thời gian để cải thiện độ ổn định phân đoạn liên khung.
Thách thức và hướng phát triển mới
Một số thách thức lớn trong phân đoạn bao gồm:
- Thiếu dữ liệu nhãn pixel chuẩn — việc gán nhãn pixel rất tốn thời gian
- Chênh lệch giữa các lớp (class imbalance) — một số lớp chiếm số pixel rất ít dẫn đến mô hình thiên lệch
- Độ phức tạp mô hình cao, yêu cầu nhiều tài nguyên tính toán, khó áp dụng trên thiết bị hạn chế
- Khả năng tổng quát hóa yếu khi dữ liệu đánh giá khác phân phối so với dữ liệu huấn luyện
Xu hướng mới tập trung vào:
- Phân đoạn “label-efficient” — dùng giám sát yếu, bán giám sát hoặc không giám sát để giảm nhu cầu nhãn pixel
- Kiến trúc mạng chú ý (attention) và Transformer trong segmentation (không gian và thời gian)
- Phương pháp lai (hybrid) kết hợp học sâu với thuật toán truyền thống để đạt độ ổn định và hiệu quả
- Áp dụng mạng nhẹ, tối ưu hóa mô hình cho thiết bị biên (edge devices) và làm segmentation real-time
Kết luận
Phân đoạn là bước nền tảng trong nhiều hệ thống nhận thức và xử lý dữ liệu, từ hình ảnh y tế đến video và dữ liệu chuỗi. Với sự phát triển của học sâu và phương pháp giám sát yếu, phân đoạn ngày càng trở nên linh hoạt, hiệu quả và dễ áp dụng trong thực tế.
Kiến trúc học sâu tiên tiến trong phân đoạn ảnh y tế và thị giác máy tính
Bên cạnh các kiến trúc mạng tích chập kinh điển như U-Net và FCN, lĩnh vực phân đoạn ảnh số (image segmentation) đã chứng kiến sự bùng nổ của các mô hình học sâu hiện đại dựa trên cơ chế tự chú ý (self-attention mechanism) và mô hình thị giác nền tảng (foundation models). Điển hình là kiến trúc TransUNet, kết hợp sức mạnh trích xuất đặc trưng cục bộ của mạng tích chập CNN với khả năng nắm bắt ngữ cảnh toàn cục tầm xa của Vision Transformer (ViT), khắc phục triệt để hạn chế trường tiếp nhận hữu hạn của các lớp tích chập truyền thống trong phân đoạn tổn thương mô bệnh học phức tạp.
Đặc biệt, sự ra đời của mô hình nền tảng Segment Anything Model (SAM) của Meta AI đã thiết lập chuẩn mực mới cho phân đoạn ảnh tương tác không cần huấn luyện trước (zero-shot segmentation). SAM được huấn luyện trên tập dữ liệu khổng lồ SA-1B (hơn 11 triệu ảnh và 1 tỷ mặt nạ phân đoạn), cho phép phân đoạn chính xác bất kỳ đối tượng mục tiêu nào chỉ dựa trên các lời nhắc (prompts) trực quan linh hoạt như điểm chấm (points), khung hộp giới hạn (bounding boxes) hoặc văn bản mô tả tự nhiên. Trong phân tích ảnh viễn thám và chẩn đoán hình ảnh y khoa, các biến thể thích ứng như MedSAM đang giúp tự động hóa phân đoạn cơ quan giải phẫu và khối u với độ chính xác và tốc độ vượt trội.
Các thước đo đánh giá định lượng độ chính xác phân đoạn
Để lượng giá khách quan hiệu năng của thuật toán phân đoạn trên các bộ dữ liệu chuẩn (như COCO, Cityscapes hoặc Pascal VOC), các chỉ số toán học thống kê sau đây được sử dụng:
- Mean Intersection over Union (mIoU): Thước đo tiêu chuẩn vàng trong phân đoạn ngữ nghĩa, tính bằng trung bình cộng tỷ lệ diện tích phần giao trên diện tích phần hợp giữa mặt nạ dự đoán (P) và mặt nạ chuẩn thực tế (G) trên toàn bộ các lớp đối tượng:
trong đó là tổng số lớp đối tượng, lần lượt là số lượng điểm ảnh dương tính thật, dương tính giả và âm tính giả của lớp .
- Hệ số tương đồng Dice (Dice Similarity Coefficient - DSC): Rất phổ biến trong phân đoạn ảnh y tế do độ nhạy cao với sự mất cân bằng giữa vùng tổn thương nhỏ và nền ảnh lớn:
Mối quan hệ trực tiếp giữa hai đại lượng được xác lập qua công thức .
- Khoảng cách Hausdorff 95% (HD95): Đo lường sai số tối đa giữa các điểm biên của bề mặt dự đoán và bề mặt thực tế ở phân vị thứ 95 nhằm loại bỏ ảnh hưởng của các điểm ngoại lai, phản ánh độ khít khao của ranh giới phân đoạn trong can thiệp xạ trị hoặc phẫu thuật có định vị.