Từ điển học thuật Khoa học tự nhiên

Học chuyển giao là gì? Các nghiên cứu khoa học liên quan

Tiếng AnhTransfer Learning

Tên gọi khácchuyển giao tri thức học máyhọc thích ứng miền

Học chuyển giao là kỹ thuật học máy áp dụng kiến thức và biểu diễn đặc trưng thu được từ một bài toán nguồn để giải quyết một bài toán mục tiêu mới có liên quan.

161 lượt xem Cập nhật 19/9/2026

Học chuyển giao (Transfer Learning) là một phương pháp luận và kỹ thuật trọng tâm trong học máy (machine learning) và trí tuệ nhân tạo, cho phép tận dụng tri thức, các trọng số tham số và biểu diễn đặc trưng đã được học từ một tác vụ (task) hoặc miền dữ liệu (domain) nguồn để áp dụng, giải quyết một tác vụ mục tiêu mới có liên quan. Khác với mô hình học máy truyền thống vốn giả định tập dữ liệu huấn luyện và kiểm tra độc lập và đồng phân phối (i.i.d.), học chuyển giao phá vỡ giả định này nhằm nâng cao hiệu năng dự báo trong bối cảnh dữ liệu mục tiêu bị khan hiếm hoặc khó khăn trong việc gán nhãn thủ công.

Trong bối cảnh chi phí tính toán và dán nhãn dữ liệu ngày càng đắt đỏ, học chuyển giao đã trở thành chiến lược chủ đạo giúp giảm thiểu đáng kể thời gian hội tụ và tài nguyên tính toán. Mô hình nền tảng thường được huấn luyện sơ bộ (pre-training) trên các tập dữ liệu tổng quát khổng lồ (như ImageNet trong thị giác máy tính hay kho ngữ liệu văn bản web đa ngôn ngữ), sau đó được tinh chỉnh (fine-tuning) thích ứng với miền ứng dụng chuyên biệt như chẩn đoán hình ảnh y sinh, phát hiện lỗi công nghiệp hoặc phân tích tài chính.

Về mặt hình thức toán học, một bài toán học chuyển giao được đặc trưng bởi hai thành phần: miền nguồn (source domain) DS={XS,PS(X)} D_S = \{X_S, P_S(X)\} và miền mục tiêu (target domain) DT={XT,PT(X)} D_T = \{X_T, P_T(X)\} . Mục tiêu tối thượng là tìm kiếm hàm dự báo tối ưu fT f_T trên miền DT D_T bằng cách tận dụng tri thức từ DS D_S , ngay cả khi không gian đặc trưng khác biệt XS≠XT X_S \ne X_T hoặc phân phối xác suất biên khác nhau PS(X)≠PT(X) P_S(X) \ne P_T(X) .

Các phân loại học chuyển giao trong học máy

Dựa trên mối quan hệ giữa không gian miền dữ liệu và không gian tác vụ, cũng như tính sẵn có của dữ liệu có nhãn ở nguồn và đích, học chuyển giao được phân loại thành ba nhóm phương thức chính:

  • Học chuyển giao quy nạp (Inductive Transfer Learning): tác vụ nguồn và tác vụ mục tiêu khác nhau (TS≠TT T_S \ne T_T ), trong khi dữ liệu miền mục tiêu có một số lượng nhãn nhất định để định hướng quá trình huấn luyện hàm mục tiêu.
  • Học chuyển giao xuyên nạp (Transductive Transfer Learning / Domain Adaptation): tác vụ nguồn và mục tiêu tương đồng (TS=TT T_S = T_T ), nhưng miền dữ liệu khác biệt (DS≠DT D_S \ne D_T ); dữ liệu miền mục tiêu hoàn toàn không có nhãn hoặc chỉ có nhãn ở miền nguồn.
  • Học chuyển giao không giám sát (Unsupervised Transfer Learning): không có dữ liệu gán nhãn ở cả tác vụ nguồn lẫn tác vụ mục tiêu, tập trung vào việc học các biểu diễn đặc trưng tiềm ẩn chung hoặc giảm chiều dữ liệu.
Phân loại Miền (Domain) Tác vụ (Task) Ứng dụng tiêu biểu
Inductive Tương đồng hoặc khác biệt Khác nhau Phân loại văn bản, phát hiện đối tượng từ mô hình trích xuất đặc trưng
Transductive Khác nhau Tương đồng Thích nghi miền ảnh nghệ thuật sang ảnh chụp thực tế, dịch đa miền
Unsupervised Khác nhau Khác nhau Phân cụm dữ liệu đa nguồn, học biểu diễn tự giám sát (self-supervised)

Cấu trúc toán học và các thành phần cốt lõi

Học chuyển giao được định nghĩa chặt chẽ thông qua các khái niệm toán học nền tảng:

  • Miền dữ liệu (Domain): được xác định bởi cặp D={X,P(X)} D = \{X, P(X)\} , bao gồm không gian đặc trưng X X và phân phối xác suất biên P(X) P(X) .
  • Tác vụ (Task): được xác định bởi cặp T={Y,f(⋅)} T = \{Y, f(\cdot)\} , bao gồm không gian nhãn Y Y và hàm ánh xạ mục tiêu f:X→Y f: X \rightarrow Y .
  • Chiến lược chuyển giao: phương thức giải tích và tối ưu hóa nhằm truyền dẫn thông tin giữa cặp DS,TS D_S, T_S và cặp DT,TT D_T, T_T để nâng cao năng lực của fT f_T .

Khi tồn tại sự sai khác DS≠DT D_S \ne D_T hoặc TS≠TT T_S \ne T_T , thuật toán cần áp dụng các biện pháp căn chỉnh như học biểu diễn bất biến miền (domain-invariant representation learning) để triệt tiêu sự phân kỳ giữa PS(X) P_S(X) và PT(X) P_T(X) , qua đó hạn chế tối đa nguy cơ chuyển giao tiêu cực (negative transfer).

Các kỹ thuật triển khai chuyển giao đặc trưng phổ biến

Trong thực tế phát triển các mô hình học sâu, các kỹ thuật học chuyển giao chủ đạo bao gồm:

  • Trích xuất đặc trưng (Feature Extraction): giữ đóng băng (freeze) các trọng số của các tầng mạng sâu phía dưới từ mô hình tiền huấn luyện và chỉ huấn luyện lại các tầng phân loại trên cùng bằng dữ liệu đích.
  • Tinh chỉnh trọng số (Fine-tuning): cập nhật toàn bộ hoặc một nhóm tầng trên cùng của mạng nơ-ron với tốc độ học (learning rate) nhỏ nhằm điều chỉnh biểu diễn thích ứng tối ưu với dữ liệu miền đích.
  • Thích ứng miền đối nghịch (Adversarial Domain Adaptation): sử dụng mạng phân biệt miền (domain discriminator) kết hợp tầng đảo ngược gradient (GRL) để ép bộ trích xuất đặc trưng tạo ra các biểu diễn không phân biệt được giữa nguồn và đích.
  • Học đa nhiệm (Multi-task Learning): tối ưu hóa đồng thời hàm mất mát của nhiều tác vụ có mối liên hệ nội tại nhằm chia sẻ biểu diễn trung gian tổng quát.
Kỹ thuật Mức độ linh hoạt Nhu cầu dữ liệu đích Chi phí điện toán
Feature Extraction Trung bình Rất thấp Thấp
Fine-tuning Cao Trung bình Trung bình
Domain Adaptation Rất cao Chỉ cần dữ liệu không nhãn Cao
Multi-task Learning Toàn diện Đa dạng các tác vụ Rất cao

Ứng dụng thực tiễn của học chuyển giao trong trí tuệ nhân tạo

Học chuyển giao là động lực công nghệ đứng sau các đột phá lớn của trí tuệ nhân tạo đương đại. Trong xử lý ngôn ngữ tự nhiên, sự xuất hiện của các kiến trúc Transformer tiền huấn luyện đã thiết lập các chuẩn mực hiệu năng mới cho các bài toán phân loại sắc thái cảm xúc, tóm tắt văn bản và trả lời câu hỏi tự động.

Trong thị giác máy tính, việc tinh chỉnh các mạng tích chập và Vision Transformer cho phép các hệ thống y tế hỗ trợ bác sĩ chẩn đoán khối u, phân tích phim chụp X-quang và chụp cắt lớp với độ chính xác tương đương chuyên gia, giải quyết bài toán thiếu hụt mẫu bệnh phẩm hiếm gặp.

Định lượng hiệu quả chuyển giao và hiện tượng chuyển giao tiêu cực

Để đánh giá định lượng sự đóng góp của tri thức nguồn, các nhà nghiên cứu sử dụng tỷ số chuyển giao (Transfer Ratio):

R=AtransferAscratchR = \frac{A_{transfer}}{A_{scratch}}

trong đó AtransferA_{transfer} biểu thị độ chính xác hoặc hiệu năng của mô hình chuyển giao, còn AscratchA_{scratch} là hiệu năng của mô hình huấn luyện từ đầu trên cùng tập dữ liệu mục tiêu.

Nếu miền nguồn và miền mục tiêu không có mối liên hệ ngữ nghĩa thực sự, việc cố gắng áp dụng học chuyển giao có thể dẫn đến hiện tượng chuyển giao tiêu cực (negative transfer), làm suy giảm độ chính xác của mô hình mục tiêu so với việc huấn luyện độc lập từ đầu. Do đó, việc đo lường độ tương đồng phân phối giữa các miền là bước tiền xử lý bắt buộc.

Thích ứng miền và các thước đo khoảng cách phân phối

Một thách thức trung tâm trong học chuyển giao là bài toán thích ứng miền (Domain Adaptation), khi có sự trôi dạt phân phối (distribution drift) giữa dữ liệu nguồn và dữ liệu đích. Để định lượng và thu hẹp khoảng cách này, nhiều thước đo toán học đã được phát triển:

  • Độ lệch trung bình cực đại (Maximum Mean Discrepancy - MMD): ánh xạ dữ liệu vào không gian Hilbert tái tạo hạt nhân (RKHS) để so sánh các mô-men thống kê giữa hai phân phối mà không cần ước lượng mật độ xác suất trực tiếp.
  • Khoảng cách Wasserstein (Earth Mover's Distance): xuất phát từ lý thuyết vận chuyển tối ưu, đo lường chi phí tối thiểu để biến đổi phân phối nguồn thành phân phối đích, mang lại độ dốc mượt mà hỗ trợ tối ưu hóa mạng nơ-ron ổn định.
  • Phân kỳ Kullback-Leibler và Jensen-Shannon: đánh giá mức độ bất đối xứng và độ phân kỳ thông tin giữa các phân phối xác suất dự báo.

Mô hình nền tảng và xu hướng phát triển tương lai

Sự tiến hóa của học chuyển giao hiện đại gắn liền với sự trỗi dậy của các mô hình nền tảng (foundation models) có hàng tỷ tham số. Nhờ khả năng học theo ngữ cảnh (in-context learning), các mô hình ngôn ngữ lớn và mô hình thị giác đa phương thức có thể thực hiện học chuyển giao ít mẫu (few-shot) hoặc không cần mẫu huấn luyện bổ sung (zero-shot transfer).

Các hướng nghiên cứu mũi nhọn hiện nay tập trung vào kỹ thuật tinh chỉnh hiệu quả tham số (Parameter-Efficient Fine-Tuning - PEFT như LoRA, QLoRA, Prefix Tuning), cho phép chỉ tối ưu hóa một tỷ lệ rất nhỏ số lượng tham số mà vẫn đạt hiệu quả tương đương fine-tuning toàn bộ mô hình. Bên cạnh đó, các vấn đề học liên tục không quên tri thức cũ (continual learning) và chuyển giao kiến thức đa phương thức tích hợp ngôn ngữ, hình ảnh và tín hiệu âm thanh đồng thời đang là trọng tâm của cộng đồng nghiên cứu quốc tế.

Câu hỏi thường gặp

Học chuyển giao khác với việc huấn luyện mô hình từ đầu (train from scratch) như thế nào?

Huấn luyện từ đầu yêu cầu tập dữ liệu lớn đã gán nhãn và khởi tạo trọng số ngẫu nhiên; trong khi học chuyển giao khởi tạo mô hình bằng các trọng số đã học từ miền nguồn, giúp giảm mạnh chi phí tính toán và nhu cầu dữ liệu ở miền đích.

Hiện tượng chuyển giao tiêu cực (negative transfer) là gì?

Hiện tượng chuyển giao tiêu cực xảy ra khi thông tin học từ tác vụ nguồn không tương thích hoặc gây nhiễu, dẫn đến kết quả mô hình mục tiêu có độ chính xác thấp hơn so với việc học độc lập từ đầu.

Kỹ thuật trích xuất đặc trưng (feature extraction) và tinh chỉnh (fine-tuning) khác nhau ra sao?

Trích xuất đặc trưng giữ cố định (đóng băng) các trọng số của tầng biểu diễn phía dưới và chỉ huấn luyện tầng phân loại mới; trong khi tinh chỉnh cho phép cập nhật lại một phần hoặc toàn bộ trọng số của mô hình với tốc độ học nhỏ.

Tài liệu tham khảo

  1. Pan, Yang (2010). A Survey on Transfer Learning. IEEE Transactions on Knowledge and Data Engineering. DOI: 10.1109/tkde.2009.191
  2. Weiss, Khoshgoftaar, Wang (2016). A survey of transfer learning. Journal of Big Data. DOI: 10.1186/s40537-016-0043-6
  3. Zhuang et al. (2021). A Comprehensive Survey on Transfer Learning. Proceedings of the IEEE. DOI: 10.1109/jproc.2020.3004555