Từ điển học thuật Kỹ thuật và công nghệ

Cơ chế chú ý là gì? Các nghiên cứu khoa học về Cơ chế chú ý

Tiếng Anhattention mechanism

Cơ chế chú ý là một kỹ thuật kiến trúc mạng nơ-ron nhân tạo trong học sâu cho phép mô hình tính toán các trọng số động để tập trung chọn lọc vào các thành phần quan trọng nhất của chuỗi dữ liệu đầu vào khi thực hiện dự đoán.

266 lượt xem Cập nhật 2/9/2026

Cơ chế chú ý (tiếng Anh: attention mechanism) là một đột phá kiến trúc trong lĩnh vực học sâu (deep learning), cho phép mô hình mạng nơ-ron tự động học và phân bổ các trọng số chú ý để tập trung có chọn lọc vào các phần thông tin quan trọng nhất của chuỗi dữ liệu đầu vào. Cơ chế này là thành phần cốt lõi tạo nên thành công của các mô hình ngôn ngữ lớn (LLM) và kiến trúc Transformer hiện đại.

Toán học của Scaled Dot-Product Attention

Theo khảo sát của Niu và cộng sự (2021) cùng Chaudhari và cộng sự (2021), mô hình chú ý tính toán sự liên kết dựa trên ba vectơ biểu diễn cơ bản: Truy vấn (QQ), Khóa (KK) và Giá trị (VV). Công thức tính toán ma trận chú ý chuẩn hóa được xác định:

Attention(Q,K,V)=softmax(QKTdk)VAttention(Q, K, V) = softmax\left(\frac{QK^T}{\sqrt{d_k}}\right) V

Ý nghĩa của các thành phần trong công thức:

  • QQ (Query): Ma trận các vectơ truy vấn đại diện cho phần tử đang cần tìm kiếm ngữ cảnh.
  • KK (Key): Ma trận các vectơ khóa đại diện cho các phần tử trong chuỗi đầu vào.
  • VV (Value): Ma trận các vectơ giá trị chứa thông tin đặc trưng của dữ liệu.
  • dkd_k: Số chiều không gian của vectơ khóa và truy vấn.

Quy trình tính toán diễn ra tuần tự qua các bước toán học:

  1. Tính tích vô hướng giữa ma trận QQ và chuyển vị của ma trận KK để đo lường mức độ tương đồng giữa các phần tử.
  2. Chia cho thừa số tỉ lệ dk\sqrt{d_k} nhằm tránh độ dốc quá nhỏ khi số chiều dkd_k lớn, sau đó áp dụng hàm softmax chuẩn hóa thành xác suất.
  3. Nhân ma trận xác suất trọng số với ma trận giá trị VV để thu được biểu diễn đầu ra tổng hợp.

Kiến trúc Chú ý Đa đầu (Multi-Head Attention)

Cơ chế Multi-Head Attention mở rộng khả năng học biểu diễn bằng cách chia không gian chú ý thành nhiều đầu song song, cho phép mô hình đồng thời nắm bắt các mối liên kết ngữ pháp và ngữ nghĩa ở các vị trí khác nhau trong chuỗi câu.

So sánh các biến thể chú ý chính

Dạng cơ chế chú ý Nguồn gốc của ma trận Q, K, V Ứng dụng tiêu biểu
Self-Attention Q, K, V cùng sinh ra từ một chuỗi đầu vào duy nhất Bộ mã hóa BERT, Transformer Encoder
Cross-Attention Q từ chuỗi giải mã, K và V từ bộ mã hóa Dịch máy tuần tự, mô hình thị giác - ngôn ngữ CLIP
Linear Attention Xấp xỉ hàm nhân để giảm độ phức tạp tính toán Mô hình chuỗi cực dài xử lý dữ liệu lớn

Tối ưu hóa độ phức tạp tính toán

Cơ chế self-attention truyền thống có độ phức tạp thời gian và bộ nhớ là O(n2)O(n^2) theo chiều dài chuỗi. Các nghiên cứu gần đây (Krig, 2025) tập trung phát triển các biến thể chú ý thưa và chú ý tuyến tính đạt độ phức tạp O(n)O(n) nhằm nâng cao hiệu suất tính toán cho dữ liệu hình ảnh độ phân giải cao và chuỗi ngữ cảnh dài.

Câu hỏi thường gặp

Scaled Dot-Product Attention được tính toán theo công thức nào?

Scaled Dot-Product Attention tính toán trọng số bằng tích vô hướng giữa ma trận truy vấn Q và ma trận khóa K, chia cho căn bậc hai của chiều không gian khóa dk, áp dụng hàm softmax rồi nhân với ma trận giá trị V: Attention(Q, K, V) = softmax(Q K^T / sqrt(dk)) V.

Multi-Head Attention mang lại lợi ích gì so với Single-Head Attention?

Multi-Head Attention cho phép mô hình chiếu Q, K, V vào nhiều không gian biểu diễn con khác nhau một cách song song. Điều này giúp mô hình đồng thời nắm bắt nhiều mối quan hệ ngữ cảnh và liên kết ngữ nghĩa phức tạp ở các vị trí khác nhau trong chuỗi.

Self-Attention và Cross-Attention khác nhau như thế nào?

Trong Self-Attention, cả ba ma trận Q, K, V đều được sinh ra từ cùng một chuỗi đầu vào (như trong Transformer Encoder). Trong Cross-Attention, Q đến từ chuỗi đích của Decoder còn K và V đến từ đầu ra của Encoder, giúp mô hình ánh xạ giữa hai miền dữ liệu khác nhau.

Tài liệu tham khảo

  1. Niu, Z., Zhong, G., & Yu, H. (2021). A review on the attention mechanism of deep learning. Neurocomputing, 452, 48-62. DOI: 10.1016/j.neucom.2021.03.091
  2. Chaudhari, S., Mithal, V., Polatkan, G., & Ramanath, R. (2021). An Attentive Survey of Attention Models. ACM Transactions on Intelligent Systems and Technology, 12(5), 1-32. DOI: 10.1145/3465055
  3. Krig, S. (2025). Attention, Transformers, Hybrids, and DDNs. In Computer Vision Metrics (pp. 581-644). Springer, Singapore. DOI: 10.1007/978-981-99-3393-8_11