Cơ chế chú ý (tiếng Anh: attention mechanism) là một đột phá kiến trúc trong lĩnh vực học sâu (deep learning), cho phép mô hình mạng nơ-ron tự động học và phân bổ các trọng số chú ý để tập trung có chọn lọc vào các phần thông tin quan trọng nhất của chuỗi dữ liệu đầu vào. Cơ chế này là thành phần cốt lõi tạo nên thành công của các mô hình ngôn ngữ lớn (LLM) và kiến trúc Transformer hiện đại.
Toán học của Scaled Dot-Product Attention
Theo khảo sát của Niu và cộng sự (2021) cùng Chaudhari và cộng sự (2021), mô hình chú ý tính toán sự liên kết dựa trên ba vectơ biểu diễn cơ bản: Truy vấn (), Khóa () và Giá trị (). Công thức tính toán ma trận chú ý chuẩn hóa được xác định:
Ý nghĩa của các thành phần trong công thức:
- (Query): Ma trận các vectơ truy vấn đại diện cho phần tử đang cần tìm kiếm ngữ cảnh.
- (Key): Ma trận các vectơ khóa đại diện cho các phần tử trong chuỗi đầu vào.
- (Value): Ma trận các vectơ giá trị chứa thông tin đặc trưng của dữ liệu.
- : Số chiều không gian của vectơ khóa và truy vấn.
Quy trình tính toán diễn ra tuần tự qua các bước toán học:
- Tính tích vô hướng giữa ma trận và chuyển vị của ma trận để đo lường mức độ tương đồng giữa các phần tử.
- Chia cho thừa số tỉ lệ nhằm tránh độ dốc quá nhỏ khi số chiều lớn, sau đó áp dụng hàm softmax chuẩn hóa thành xác suất.
- Nhân ma trận xác suất trọng số với ma trận giá trị để thu được biểu diễn đầu ra tổng hợp.
Kiến trúc Chú ý Đa đầu (Multi-Head Attention)
Cơ chế Multi-Head Attention mở rộng khả năng học biểu diễn bằng cách chia không gian chú ý thành nhiều đầu song song, cho phép mô hình đồng thời nắm bắt các mối liên kết ngữ pháp và ngữ nghĩa ở các vị trí khác nhau trong chuỗi câu.
So sánh các biến thể chú ý chính
| Dạng cơ chế chú ý | Nguồn gốc của ma trận Q, K, V | Ứng dụng tiêu biểu |
|---|---|---|
| Self-Attention | Q, K, V cùng sinh ra từ một chuỗi đầu vào duy nhất | Bộ mã hóa BERT, Transformer Encoder |
| Cross-Attention | Q từ chuỗi giải mã, K và V từ bộ mã hóa | Dịch máy tuần tự, mô hình thị giác - ngôn ngữ CLIP |
| Linear Attention | Xấp xỉ hàm nhân để giảm độ phức tạp tính toán | Mô hình chuỗi cực dài xử lý dữ liệu lớn |
Tối ưu hóa độ phức tạp tính toán
Cơ chế self-attention truyền thống có độ phức tạp thời gian và bộ nhớ là theo chiều dài chuỗi. Các nghiên cứu gần đây (Krig, 2025) tập trung phát triển các biến thể chú ý thưa và chú ý tuyến tính đạt độ phức tạp nhằm nâng cao hiệu suất tính toán cho dữ liệu hình ảnh độ phân giải cao và chuỗi ngữ cảnh dài.