Bản chất toán học và vai trò trong mạng nơ-ron
Hàm kích hoạt là hàm số toán học thực hiện phép biến đổi phi tuyến tính trên tổng có trọng số của các tín hiệu đầu vào tại một nơ-ron nhân tạo, quyết định mức độ kích hoạt và truyền tín hiệu của nơ-ron đó sang các tầng tiếp theo trong mạng nơ-ron. Thuật ngữ này giữ vai trò nền tảng trong lý thuyết học sâu và kỹ thuật mô hình hoá mạng nơ-ron nhân tạo, đảm bảo khả năng học các mối quan hệ phi tuyến phức tạp trong dữ liệu đa chiều. Bài viết trình bày chi tiết cơ chế giải tích, cơ sở toán học của định lý xấp xỉ phổ quát, các thế hệ hàm kích hoạt từ dạng nén kinh điển đến họ hàm chỉnh lưu và phân phối hiện đại, cùng những giới hạn thực nghiệm và tiêu chí chọn lựa trong triển khai kỹ thuật.
Trong cấu trúc cơ bản của một nơ-ron nhân tạo, các tín hiệu đầu vào được nhân với các trọng số liên kết tương ứng, cộng với một thành phần độ chệch trước khi truyền qua hàm kích hoạt. Mô hình tính toán được biểu diễn tổng quát theo công thức:
Trong công thức trên, đại lượng biểu diễn giá trị đầu ra của nơ-ron sau kích hoạt, ký hiệu hàm kích hoạt phi tuyến, đại diện cho trọng số liên kết tương ứng với tín hiệu đầu vào thứ , là giá trị đầu vào thứ , là số lượng tín hiệu đầu vào truyền vào nơ-ron, và là thành phần độ chệch nhằm dịch chuyển đường kích hoạt.
Phép biến đổi phi tuyến và tính phá vỡ sự tuyến tính
Vai trò quan trọng nhất của hàm kích hoạt là đưa tính phi tuyến vào kiến trúc nơ-ron. Một phép biến đổi tuyến tính thuần tuý chỉ tạo ra các siêu phẳng phân tách trong không gian đặc trưng. Giả sử xét một mạng nơ-ron truyền thẳng gồm nhiều tầng liên tiếp không sử dụng hàm kích hoạt phi tuyến hoặc chỉ áp dụng hàm đồng nhất dạng . Khi đó, tầng ẩn thứ nhất thực hiện phép tính tuyến tính với là ma trận trọng số và là vector độ chệch. Tầng ẩn thứ hai tiếp tục tính toán .
Bằng phép quy nạp toán học qua nhiều tầng ẩn, tích của chuỗi các ma trận tuyến tính luôn tương đương với một ma trận duy nhất kết hợp cùng một vector độ chệch tổng hợp . Mạng nơ-ron dù sở hữu hàng chục tầng tính toán vẫn lập tức suy biến thành một mô hình hồi quy tuyến tính đơn giản. Do đó, nếu thiếu hàm kích hoạt phi tuyến, việc tăng chiều sâu mạng hoàn toàn không mang lại lợi thế biểu diễn, và mô hình bất lực trước các bài toán phân tách phi tuyến kinh điển như cổng logic XOR hoặc phân loại ảnh phức tạp.
Định lý xấp xỉ phổ quát và nền tảng lý thuyết
Nền tảng toán học khẳng định năng lực biểu diễn của mạng nơ-ron nhân tạo bắt nguồn từ định lý xấp xỉ phổ quát. Theo công bố nền tảng của Hornik và cộng sự (1989), một mạng nơ-ron truyền thẳng chỉ cần chứa ít nhất 1 tầng ẩn với số lượng nơ-ron đủ lớn và sử dụng hàm kích hoạt dạng nén phi tuyến bất kỳ là có khả năng xấp xỉ mọi hàm đo được Borel từ không gian hữu hạn chiều này sang không gian hữu hạn chiều khác với độ chính xác tùy ý.
Đồng thời trong năm 1989, Cybenko (1989) đã chứng minh độc lập rằng tổ hợp tuyến tính hữu hạn của các hàm dạng sigmoid liên tục có thể xấp xỉ đều bất kỳ hàm liên tục nào xác định trên siêu lập phương đơn vị compact thuộc không gian thực, với toạ độ mỗi chiều nằm trong đoạn từ 0 đến 1. Dạng xấp xỉ toán học được biểu diễn như sau:
Trong biểu thức xấp xỉ trên, đại lượng là hàm xấp xỉ đầu ra, là số lượng nơ-ron ẩn, là hệ số trọng số tuyến tính ở tầng ra, là hàm kích hoạt dạng sigmoid, là vector trọng số của tầng ẩn, là vector đầu vào, và là giá trị ngưỡng độ chệch. Định lý này thiết lập nền móng vững chắc rằng việc lựa chọn hàm kích hoạt phi tuyến phù hợp là điều kiện tiên quyết để mạng nơ-ron trở thành bộ xấp xỉ hàm vạn năng.
Các họ hàm kích hoạt dạng nén kinh điển
Giai đoạn đầu của ngành trí tuệ nhân tạo và mạng nơ-ron nhân tạo chứng kiến sự thống trị của các hàm kích hoạt dạng nén, tiêu biểu là hàm Logistic Sigmoid và hàm Hyperbolic Tangent. Các hàm này lấy cảm hứng sinh học từ tần số phát xung của nơ-ron sinh học, chuyển đổi tín hiệu đầu vào liên tục thành mức kích hoạt bão hoà ở hai đầu cực.
Hàm Logistic Sigmoid và sự suy giảm gradient
Hàm Logistic Sigmoid được định nghĩa theo công thức giải tích:
Trong đó là biến số đầu vào thực và đại lượng là cơ số logarit tự nhiên. Hàm Sigmoid ánh xạ toàn bộ trục số thực vào khoảng mở từ 0 đến 1. Điểm đặc trưng của hàm này là dạng đồ thị hình chữ S trơn tru và khả vi liên tục trên toàn bộ tập xác định. Đạo hàm bậc nhất của hàm Sigmoid có tính chất đại số khép kín:
Theo tổng kết chuyên khảo của Dubey và cộng sự (2022), đạo hàm của hàm Sigmoid đạt giá trị cực đại chính xác là 0.25 tại điểm . Khi độ lớn của biến số đầu vào tiến dần về dương vô cực hoặc âm vô cực, giá trị đầu ra tiệm cận tương ứng tới 1 hoặc 0, khiến đạo hàm suy giảm tiệm cận về 0.
Đặc tính bão hoà này dẫn tới vấn đề nghiêm trọng trong học sâu: hiện tượng triệt tiêu gradient. Khi lan truyền ngược qua một chuỗi gồm nhiều tầng ẩn liên tiếp, gradient của hàm mất mát đối với trọng số ở các tầng đầu tiên được tính bằng tích của các ma trận đạo hàm theo quy tắc chuỗi. Do đạo hàm lớn nhất của Sigmoid chỉ là 0.25, tích luỹ đạo hàm qua chuỗi tầng ẩn sẽ giảm theo hàm số mũ cơ số nhỏ hơn 1. Hệ quả là các tầng nơ-ron gần đầu vào hầu như không nhận được tín hiệu cập nhật trọng số, làm quá trình huấn luyện mạng sâu bị đình trệ hoàn toàn. Thêm vào đó, miền giá trị của Sigmoid luôn mang dấu dương (không đối xứng quanh gốc toạ độ 0), gây hiện tượng dao động zigzag của vector gradient trong quá trình tối ưu hoá tham số.
Hàm Hyperbolic Tangent và tính chất đối xứng quanh gốc toạ độ
Nhằm khắc phục nhược điểm không cân bằng qua 0 của hàm Sigmoid, hàm Hyperbolic Tangent (Tanh) được áp dụng phổ biến trong mạng nơ-ron truyền thẳng và mạng nơ-ron hồi quy. Hàm Tanh được định nghĩa theo tỷ số của các hàm số mũ:
Đạo hàm bậc nhất của hàm Tanh được suy dẫn qua biểu thức:
Theo phân tích của Dubey và cộng sự (2022), hàm Tanh ánh xạ toàn bộ trục số thực vào đoạn giá trị từ -1 đến 1 và đối xứng tâm qua gốc toạ độ 0. Nhờ tính chất trung tâm đối xứng này, kỳ vọng toán học của tín hiệu đầu ra gần bằng 0, giúp chuẩn hoá dữ liệu trung gian và đẩy nhanh tốc độ hội tụ của thuật toán giảm độ dốc. Đạo hàm của hàm Tanh đạt giá trị cực đại bằng 1.0 tại gốc toạ độ 0, cao hơn gấp 4 lần so với cực đại 0.25 của hàm Sigmoid.
Mặc dù vậy, khi giá trị đầu vào vượt qua ngưỡng kích thích nhất định theo cả hai phía âm và dương, hàm Tanh vẫn gặp hiện tượng bão hoà hai đầu cực. Đạo hàm bậc nhất tiệm cận rất nhanh về 0 khi biến số đầu vào có độ lớn đáng kể, khiến hiện tượng triệt tiêu gradient vẫn tái diễn khi huấn luyện các mô hình có độ sâu lớn hơn vài tầng ẩn.
Họ hàm kích hoạt chỉnh lưu và các biến thể nâng cao
Sự bùng nổ của học sâu vào đầu thập niên thứ hai của thế kỷ hai mươi mốt gắn liền với cuộc cách mạng thay thế các hàm dạng nén bằng các hàm kích hoạt chỉnh lưu tuyến tính từng đoạn. Sự thay đổi căn bản này giải quyết triệt để vấn đề triệt tiêu gradient ở miền kích hoạt dương và giảm thiểu đáng kể chi phí tính toán.
Hàm ReLU và hiện tượng nơ-ron chết
Hàm chỉnh lưu tuyến tính (Rectified Linear Unit, viết tắt là ReLU) được định nghĩa bằng hàm lấy giá trị cực đại đơn giản:
Đạo hàm của hàm ReLU trên từng khoảng xác định mang dạng hằng số:
Tại điểm gốc toạ độ , hàm số không khả vi theo nghĩa giải tích cổ điển nhưng được gán đạo hàm dưới bằng 0 hoặc 1 trong các bộ thư viện tính toán tự động. Theo tổng kết của Dubey và cộng sự (2022), hàm ReLU bắt đầu được ứng dụng đột phá từ năm 2010 nhằm giải quyết rào cản tính toán giải tích phức tạp của hàm Sigmoid và Tanh, do hàm ReLU chỉ đòi hỏi một phép so sánh logic với ngưỡng 0 thay vì các phép tính số mũ tốn kém.
Ưu điểm nổi bật nhất của ReLU là giữ nguyên gradient bằng 1 trên toàn bộ nửa trục số dương. Đặc tính này ngăn chặn hoàn toàn hiện tượng suy giảm gradient khi lan truyền ngược qua các nơ-ron đang hoạt động, cho phép huấn luyện các mạng nơ-ron có độ sâu lớn. Ngoài ra, việc trả về giá trị 0 cho mọi đầu vào âm tạo ra tính thưa tự nhiên trong không gian kích hoạt, giúp mô hình tiết kiệm bộ nhớ và tăng cường tính khái quát hoá.
Tuy nhiên, ReLU tồn tại nhược điểm cố hữu mang tên hiện tượng nơ-ron chết. Khi một gradient rất lớn cập nhật làm nơ-ron bị dịch chuyển độ chệch âm sâu, nơ-ron đó sẽ luôn nhận giá trị âm cho hầu hết dữ liệu huấn luyện. Do đạo hàm bằng 0 ở miền âm, gradient lan truyền ngược qua nơ-ron này hoàn toàn biến mất, khiến trọng số liên kết không bao giờ được cập nhật tiếp. Nơ-ron rơi vào trạng thái ngừng hoạt động vĩnh viễn, làm giảm sút dung lượng biểu diễn của mô hình.
Các biến thể Leaky ReLU và PReLU
Để giải quyết dứt điểm nhược điểm nơ-ron chết của ReLU, nhiều biến thể nâng cao đã được nghiên cứu và chuẩn hoá. Theo phân tích của Dubey và cộng sự (2022), biến thể Leaky ReLU được công bố từ năm 2013 nhằm khắc phục nhược điểm không sử dụng miền âm bằng cách áp dụng một độ dốc nhỏ cố định, thường chọn là 0.01 cho miền đầu vào âm:
Hệ số 0.01 đảm bảo rằng ngay cả khi đầu vào mang giá trị âm, nơ-ron vẫn duy trì một dòng gradient nhỏ chảy ngược về các tầng trước, ngăn chặn tình trạng nơ-ron bị khoá chết hoàn toàn. Tuy nhiên, việc cố định hệ số 0.01 mang tính kinh nghiệm và không tối ưu cho mọi tập dữ liệu.
Nhằm vượt qua giới hạn của hệ số cố định, He và cộng sự (2015) đã đề xuất hàm kích hoạt chỉnh lưu tham số hoá (Parametric Rectified Linear Unit, viết tắt là PReLU). Thay vì gán cứng một hằng số, hệ số góc miền âm được coi là một tham số tự do học được trong quá trình tối ưu hoá:
Trong công thức PReLU, ký hiệu đại diện cho tín hiệu đầu vào hàm kích hoạt tại kênh thứ , và tham số là hệ số điều khiển độ dốc của nhánh âm tương ứng với kênh đó. Khi tham số , hàm chuyển về dạng ReLU cơ bản; khi , hàm trở thành Leaky ReLU. Gradient của hàm mất mát đối với tham số học được được tính giải tích qua quy tắc chuỗi, cho phép mô hình tự động thích nghi mức độ phi tuyến tại từng tầng mạng.
Trong công trình thực nghiệm quy mô lớn trên tập dữ liệu phân loại ImageNet 2012, He và cộng sự (2015) ghi nhận rằng mô hình mạng nơ-ron sử dụng PReLU đã đạt mức tỷ lệ lỗi top-5 là 4.94%. Kết quả này cải thiện tương đối 26% so với thành tích 6.66% của mô hình GoogLeNet từng đoạt chức vô địch thử nghiệm ILSVRC 2014. Đáng chú ý, kết quả 4.94% của PReLU là cột mốc lịch sử đầu tiên vượt qua ngưỡng năng lực nhận diện mắt thường của con người được ghi nhận ở mức 5.1% trên cùng bộ chuẩn thị giác máy tính.
Phương pháp khởi tạo trọng số cho mạng nơ-ron chỉnh lưu sâu
Việc áp dụng hàm chỉnh lưu đòi hỏi phương pháp khởi tạo trọng số chuyên biệt. Phương pháp khởi tạo Xavier cổ điển dựa trên giả định hàm kích hoạt hoạt động ở chế độ tuyến tính quanh gốc toạ độ, một giả thiết không còn phù hợp với tính chất triệt tiêu nửa miền âm của ReLU và PReLU. He và cộng sự (2015) đã chứng minh rằng việc triệt tiêu nửa miền âm làm phương sai tín hiệu truyền thẳng suy giảm một nửa sau mỗi tầng nếu không được hiệu chỉnh.
Bằng việc mô hình hoá chặt chẽ tính phi tuyến của hàm chỉnh lưu, He và cộng sự (2015) đề xuất phương pháp khởi tạo trọng số ngẫu nhiên theo phân phối chuẩn có kỳ vọng 0 và độ lệch chuẩn bằng căn bậc hai của 2 chia cho số lượng liên kết đầu vào :
Trong công thức trên, ký hiệu trọng số tại tầng thứ , và biểu diễn số kết nối đầu vào của một nơ-ron tại tầng đó. Thừa số 2 trong tử số xuất hiện chính xác để bù đắp cho việc kỳ vọng bình phương đầu vào bị giảm đi một nửa do tác động triệt tiêu miền âm của hàm chỉnh lưu. Nhờ kỹ thuật khởi tạo này, He và cộng sự (2015) đã huấn luyện thành công các mạng nơ-ron tích chập cực sâu lên tới 30 tầng trực tiếp từ đầu mà không bị phân kỳ, điều mà phương pháp Xavier hoàn toàn thất bại. Thực nghiệm trên các cấu hình mạng 19 tầng và 22 tầng cũng xác nhận PReLU duy trì sự ổn định tối ưu hoá và tăng cường tính biểu diễn phi tuyến ở các tầng biểu diễn trừu tượng sâu hơn.
Các hàm kích hoạt hiện đại dựa trên phân phối và làm trơn
Trong giai đoạn kiến trúc Transformer và các mô hình học sâu hiện đại chiếm ưu thế, xu hướng thiết kế hàm kích hoạt chuyển dịch sang các hàm số trơn, liên tục và không đơn điệu. Những hàm kích hoạt này kết hợp giữa tác động kích hoạt cục bộ và cơ chế điều chuẩn ngẫu nhiên.
Hàm Gaussian Error Linear Unit trong các kiến trúc Transformer
Hàm kích hoạt Gaussian Error Linear Unit (GELU) được đề xuất bởi Dan Hendrycks và Kevin Gimpel vào năm 2016. Theo tổng hợp phân loại của Dubey và cộng sự (2022), hàm GELU thuộc nhóm hàm kích hoạt dựa trên phân phối xác suất và trở thành chuẩn mực mặc định trong hầu hết các kiến trúc mô hình ngôn ngữ lớn dựa trên Transformer như BERT và GPT.
Hàm GELU liên kết giá trị kích hoạt với hàm phân phối xác suất tích luỹ của phân phối chuẩn tắc. Dạng toán học định nghĩa của GELU được viết như sau:
Trong biểu thức định nghĩa trên, là giá trị đầu vào thực, là biến ngẫu nhiên tuân theo phân phối chuẩn tắc có kỳ vọng bằng 0 và phương sai bằng 1, và là hàm phân phối tích luỹ chuẩn tắc. Ý nghĩa trực giác của GELU là mở rộng cơ chế kích hoạt theo hướng xác suất: thay vì nhân tín hiệu với 0 hoặc 1 dựa trên dấu của đầu vào như hàm ReLU, GELU nhân đầu vào với xác suất đầu vào đó lớn hơn các giá trị ngẫu nhiên khác. Hàm GELU liên tục khả vi trên toàn bộ trục số thực và có một đoạn uốn trơn phi đơn điệu ở vùng giá trị âm lân cận 0, tạo điều kiện thuận lợi cho dòng gradient chảy qua nhẹ nhàng mà không gặp hiện tượng gập nhọn đạo hàm.
Hàm Sigmoid-Weighted Linear Unit và tính chất phi đơn điệu
Hàm Sigmoid-Weighted Linear Unit (SiLU), còn được cộng đồng nghiên cứu gọi là Swish, là một hàm kích hoạt trơn phi đơn điệu nổi bật khác. Theo công trình của Elfwing và cộng sự (2018), hàm SiLU và hàm đạo hàm dSiLU được thiết kế cho bài toán xấp xỉ hàm nơ-ron trong học tăng cường, định nghĩa bằng tích của biến số đầu vào với hàm Sigmoid:
Đạo hàm bậc nhất của hàm SiLU được tính toán theo quy tắc nhân giải tích:
Trong thực nghiệm của Elfwing và cộng sự (2018), mô hình học tăng cường sử dụng các đơn vị ẩn SiLU và dSiLU đã chứng minh hiệu quả vượt trội thuật toán DQN kinh điển trên môi trường trò chơi Atari 2600 cũng như trò chơi xếp hình Tetris với bảng kích thước 10. Độc lập với nghiên cứu trên, Dubey và cộng sự (2022) ghi nhận hàm Swish với dạng tham số được nhóm nghiên cứu tại Google Brain tìm thấy vào năm 2017 thông qua kỹ thuật tìm kiếm kiến trúc mạng nơ-ron tự động.
Theo phân tích hình học giải tích của Dubey và cộng sự (2022), hàm SiLU có miền giá trị bị chặn dưới bởi tiệm cận xấp xỉ mức -0.5, với điểm cực tiểu toàn cục đạt giá trị khoảng âm 0.28 khi đầu vào âm nhẹ. Tính chất không đơn điệu này cho phép một lượng nhỏ tín hiệu âm có gradient chảy ngược, bảo toàn độ nhạy của nơ-ron đối với các biến thiên nhỏ quanh gốc toạ độ và hạn chế triệt để tình trạng bão hoà cục bộ trong quá trình tối ưu hoá.
Bảng so sánh đặc tính kỹ thuật của các hàm kích hoạt
Để cung cấp cái nhìn tổng hợp cho việc đánh giá và lựa chọn giải pháp trong thiết kế mạng nơ-ron, bảng dưới đây tổng hợp các đặc tính toán học cơ bản của các hàm kích hoạt tiêu biểu, dựa trên kết quả khảo sát của Dubey và cộng sự (2022):
| Tên hàm kích hoạt | Dạng công thức giải tích | Miền giá trị đầu ra | Đặc tính đạo hàm cực đại | Đặc trưng nổi bật và ứng dụng |
|---|---|---|---|---|
| Logistic Sigmoid | Công thức: | Khoảng mở từ 0 đến 1 | Cực đại đạt 0.25 tại điểm 0 | Phù hợp lớp phân loại nhị phân; triệt tiêu gradient ở mạng sâu |
| Hyperbolic Tangent (Tanh) | Công thức: | Đoạn từ -1 đến 1 | Cực đại đạt 1.0 tại gốc toạ độ 0 | Đối xứng qua gốc toạ độ; vẫn bão hoà ở vùng đầu vào có độ lớn cao |
| ReLU | Công thức: | Nửa đoạn từ 0 đến vô cực | Bằng 1 khi dương và bằng 0 khi âm | Tính toán giải tích nhanh; nguy cơ gặp hiện tượng nơ-ron chết |
| Leaky ReLU | Công thức: | Toàn bộ trục số thực | Bằng 1 khi dương và 0.01 khi âm | Duy trì gradient nhỏ ở miền âm; khắc phục nhược điểm nơ-ron chết |
| PReLU | Công thức: | Toàn bộ trục số thực | Bằng 1 khi dương và hệ số học được khi âm | Tự động học tham số phi tuyến; tối ưu trên tập ảnh ImageNet |
| GELU | Công thức: | Toàn bộ trục số thực | Biến thiên trơn liên tục phi đơn điệu | Điều chuẩn ngẫu nhiên; chuẩn mực trong kiến trúc Transformer |
| SiLU / Swish | Công thức: | Bị chặn dưới tiệm cận mức -0.5 | Đạo hàm trơn với cực tiểu âm 0.28 | Hội tụ tốt trong học tăng cường và mô hình thị giác hiện đại |
Theo báo cáo thực nghiệm so sánh 18 hàm kích hoạt trên 4 tập dữ liệu chuẩn của Dubey và cộng sự (2022), không có một hàm kích hoạt đơn lẻ nào hoàn toàn áp đảo trên mọi tác vụ. Hiệu năng thực tế phụ thuộc mật thiết vào mối tương quan giữa dạng hàm kích hoạt, phương pháp khởi tạo tham số, chiến lược chuẩn hoá tầng và cấu trúc tổng thể của mô hình.
Thách thức thực tiễn và nguyên tắc lựa chọn hàm kích hoạt
Việc áp dụng hàm kích hoạt trong các hệ thống trí tuệ nhân tạo đặt ra nhiều thách thức kỹ thuật đòi hỏi sự cân nhắc thấu đáo giữa độ chính xác dự báo và hiệu năng thực thi phần cứng.
Các vấn đề tối ưu hoá và độ ổn định số học
Một thách thức phổ biến khi lập trình mô hình học sâu là độ ổn định số học trong tính toán dấu phẩy động. Các hàm kích hoạt chứa thành phần luỹ thừa số mũ như Sigmoid, Tanh, hay Softplus (vốn được đề xuất từ năm 2001) dễ gây ra lỗi tràn số trên hoặc tràn số dưới khi độ lớn của đầu vào vượt quá ngưỡng biểu diễn của kiểu dữ liệu dấu phẩy động bán chính xác hay độ chính xác đơn. Để bảo đảm tính chính xác, các framework học máy thường phải triển khai các phép biến đổi toán học tương đương ở cấp độ số học, chẳng hạn như kỹ thuật LogSumExp hoặc cắt ngưỡng giá trị đầu vào.
Bên cạnh độ ổn định số học, chi phí phần cứng là tiêu chí then chốt trong triển khai mô hình biên. Dù các hàm kích hoạt trơn như GELU và SiLU cho kết quả vượt trội về độ chính xác trên các bài toán nhận dạng ngôn ngữ và thị giác, chúng đòi hỏi chu kỳ xử lý xung nhịp cao hơn nhiều so với phép so sánh logic đơn giản của ReLU. Trên các chip chuyên dụng như vi điều khiển hoặc mảng cổng lập trình được, việc xấp xỉ các hàm phi tuyến dạng trơn bằng chuỗi đa thức bậc thấp hoặc bảng tra cứu là giải pháp bắt buộc để cân bằng giữa độ chính xác và độ trễ phản hồi.
Xu hướng phát triển và triển vọng nghiên cứu
Tính đến năm 2026, nghiên cứu học sâu tiếp tục ứng dụng các biến thể hàm kích hoạt như GELU và SwiGLU trong các mô hình xử lý ngôn ngữ quy mô lớn. Các biến thể phối hợp giữa hàm kích hoạt trơn và cổng nhân tuyến tính chứng minh khả năng cải thiện đáng kể tốc độ hội tụ và giảm độ rối loạn của mô hình ngôn ngữ trong quá trình tiền huấn luyện trên các cụm siêu máy tính.
Song song với các mô hình tham số cố định, hướng đi nghiên cứu các hàm kích hoạt học được và thích nghi động theo ngữ cảnh dữ liệu tiếp tục mở rộng. Việc tự động hoá tìm kiếm cấu trúc hàm kích hoạt tối ưu hoá riêng cho từng tầng kiến trúc, kết hợp với các thuật toán khởi tạo trọng số tự chuẩn hoá, mở ra tiềm năng tối đa hoá năng lực xấp xỉ hàm của mạng nơ-ron mà không làm gia tăng kích thước tham số lưu trữ.
Tính đến các năm 2024 và 2025, các chương trình đào tạo trí tuệ nhân tạo và kỹ thuật học máy đã chuẩn hoá việc giảng dạy các hàm kích hoạt cơ bản. Việc nắm vững bản chất giải tích, nguồn gốc hình thành và các hệ quả gradient của từng loại hàm kích hoạt là tri thức cốt lõi giúp các kỹ sư và nhà nghiên cứu thiết kế các kiến trúc học sâu mạnh mẽ, ổn định và hiệu quả cao trong thực tiễn.