Mạng nơ-ron nhân tạo (tiếng Anh: artificial neural network, viết tắt: ANN) là một mô hình tính toán lấy cảm hứng từ cấu trúc mạng lưới tế bào thần kinh sinh học trong não bộ động vật. ANN bao gồm các đơn vị xử lý thông tin cơ bản gọi là nơ-ron nhân tạo (hoặc nút), được tổ chức thành các lớp và liên kết với nhau bằng các kết nối có trọng số đại số biến thiên.
Cấu trúc toán học của một nơ-ron nhân tạo
Mô hình nơ-ron nhân tạo kinh điển (Perceptron) tiếp nhận một vector đầu vào và tạo ra tín hiệu đầu ra thông qua hai giai đoạn biến đổi:
- Tổng có trọng số và độ lệch (Linear combination):
Trong đó là các trọng số liên kết (weights) và là hệ số điều chỉnh độ lệch (bias).
- Hàm kích hoạt phi tuyến (Activation function):
Hàm đưa tính phi tuyến tính vào mạng, cho phép mô hình xấp xỉ các hàm số phức tạp bất kỳ theo Định lý xấp xỉ phổ quát (Universal Approximation Theorem).
Các hàm kích hoạt phổ biến
Sự lựa chọn hàm kích hoạt ảnh hưởng trực tiếp đến tốc độ hội tụ và tính ổn định của quá trình huấn luyện:
- Hàm Sigmoid: , ánh xạ đầu vào vào khoảng , thường dùng cho lớp đầu ra của bài toán phân loại nhị phân. Nhược điểm là hiện tượng triệt tiêu đạo hàm (vanishing gradient) khi lớn.
- Hàm Tang hyperbolic (Tanh): , ánh xạ vào khoảng , đối xứng quanh điểm 0.
- Hàm Đơn vị chỉnh lưu tuyến tính (ReLU): , tính toán cực kỳ nhanh và giảm thiểu triệt tiêu đạo hàm, là hàm kích hoạt tiêu chuẩn cho các lớp ẩn trong mạng sâu.
- Hàm Softmax: Chuẩn hóa vector đầu ra của lớp cuối cùng thành một phân phối xác suất có tổng bằng 1 trong các bài toán phân loại đa lớp.
Kiến trúc mạng nơ-ron nhiều lớp (MLP)
Mạng nơ-ron truyền thẳng nhiều lớp (Multilayer Perceptron - MLP) bao gồm:
- Lớp đầu vào (Input Layer): Tiếp nhận các đặc trưng thô của dữ liệu quan sát.
- Một hoặc nhiều lớp ẩn (Hidden Layers): Thực hiện các phép biến đổi đặc trưng phi tuyến liên tiếp để trích xuất các biểu diễn trừu tượng ở mức độ cao.
- Lớp đầu ra (Output Layer): Tạo ra giá trị dự báo cuối cùng (nhãn phân loại hoặc giá trị hồi quy liên tục).
Quá trình huấn luyện và Thuật toán lan truyền ngược
Mục tiêu của việc huấn luyện mạng nơ-ron là tìm bộ trọng số và bias sao cho hàm mất mát đạt giá trị nhỏ nhất trên tập dữ liệu huấn luyện.
- Lan truyền xuôi (Forward Propagation): Tín hiệu truyền từ lớp đầu vào qua các lớp ẩn để tính giá trị đầu ra và hàm mất mát.
- Lan truyền ngược (Backpropagation): Áp dụng quy tắc dây xích của giải tích vi phân để tính đạo hàm riêng (gradient) của hàm mất mát đối với từng trọng số:
- Cập nhật trọng số (Gradient Descent): Cập nhật trọng số theo hướng ngược vector gradient với tốc độ học :
Các thuật toán tối ưu hóa hiện đại như Adam, RMSprop hay SGD with Momentum giúp tăng tốc độ hội tụ và vượt qua các điểm cực tiểu cục bộ.
Các biến thể kiến trúc chuyên biệt
Từ kiến trúc MLP cơ bản, các kiến trúc mạng chuyên biệt đã được phát triển:
- CNN (Convolutional Neural Network): Tận dụng phép tích chập không gian để xử lý dữ liệu dạng lưới 2D/3D như hình ảnh và video.
- RNN / LSTM / GRU: Có các kết nối hồi quy có trạng thái nhớ để xử lý dữ liệu chuỗi thời gian, âm thanh và văn bản.
- Transformer: Dựa hoàn toàn trên cơ chế Attention, xử lý song song vượt trội và mở đường cho các mô hình ngôn ngữ lớn hiện nay.